WavLM:大規模自督導式預訓練用於全棧語音處理
大多數語音 SSL 模型針對 ASR 優化,並希望其他一切都能順利進行。
大多數語音 SSL 模型針對 ASR 優化,並希望其他一切都能順利進行。來自 Microsoft 的 WavLM 採用相反的方式構建——預訓練一次,完成所有任務:識別、說話者驗證、分化、分離、完整的 SUPERB 基準。訣竅是 Transformer 中的門控相對位置偏差加上預訓練期間的語句混合,這迫使模型學習說話者感知和噪聲魯棒的表示,而不僅是語音表示。
推出時在 SUPERB 排行榜上取得了全面勝利,在 HuBERT 和 wav2vec 2.0 往往供應不足的非 ASR 任務上獲得了特別強的收益。本節介紹了訓練時語句混合的實際樣子、位置偏差為何對更長的上下文很重要,以及如何組裝 94k 小時的預訓練語料庫。如果您厭倦了為每個下游語音任務維護單獨的編碼器,WavLM 是今天在 HuggingFace 上可用的最強單骨幹賭注之一——深度探討值得排隊。
