WavLM: 大规模自监督预训练用于全栈语音处理
大多数语音 SSL 模型针对 ASR 进行优化,希望其他一切顺利进行。
大多数语音 SSL 模型针对 ASR 进行优化,希望其他一切顺利进行。由 Microsoft 开发的 WavLM 采取相反的方向——预训练一次,做所有事情:识别、说话人验证、分段、分离、完整的 SUPERB 基准。诀窍是 transformer 中的门控相对位置偏差加上预训练期间的话语混合,这强制模型学习说话人感知和抗噪声的表示,而不仅仅是语音学的。
结果是在发布时对 SUPERB 排行榜的全面占领,在非 ASR 任务上取得特别强的增益,这些任务往往被 HuBERT 和 wav2vec 2.0 所忽视。本课程讲述了话语混合在训练时的实际样子、为什么位置偏差对较长上下文很重要,以及 94k 小时预训练语料库是如何组装的。如果您厌倦了为每个下游语音任务维护单独的编码器,WavLM 是 HuggingFace 上今天可用的最强大的单骨干网络之一——深入研究值得一看。
