HuBERT:通过隐藏单元掩蔽预测进行自监督语音表示学习
wav2vec 2.0 通过对比自监督改变了一切,但 HuBERT 提出了一个更尖锐的问题:如果我们完全跳过对比技巧,只在语音上进行 BERT 风格的掩蔽预测呢?
wav2vec 2.0 通过对比自监督改变了一切,但 HuBERT 提出了一个更尖锐的问题:如果我们完全跳过对比技巧,只在语音上进行 BERT 风格的掩蔽预测呢?问题在于音频没有自然的词汇,所以 HuBERT 自行引导——首先聚类 MFCC,然后迭代地重新聚类模型自身的隐藏状态——并训练 Transformer 在掩蔽帧上预测那些伪标签。
收益是一个更干净的目标,在 Librispeech 和 Libri-light 上,结果在从 Base 到 X-Large 的每个模型规模上都能匹配或超越 wav2vec 2.0。Meta AI 的这次深度探讨介绍了 k-means 引导循环、为什么声学单元从迭代中出现,以及相同的预训练如何干净地转移到 ASR、说话者识别和情感任务。HuBERT 从此成为 HuggingFace 上任何从事语音表示工作的人的默认起点之一,所以如果你为下一个 ASR 或 SLU 项目选择编码器,花几分钟理解这里的直觉将为你节省数小时的超参数调优时间。
