HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units

Tutorials

HuBERT:通過隱藏單位的掩蓋預測進行自監督語音表示學習

wav2vec 2.0 通過對比自監督改變了遊戲規則,但 HuBERT 提出了一個更尖銳的問題:如果我們完全跳過對比技巧,只在語音上進行 BERT 風格的掩蓋預測會怎樣?

wav2vec 2.0 通過對比自監督改變了遊戲規則,但 HuBERT 提出了一個更尖銳的問題:如果我們完全跳過對比技巧,只在語音上進行 BERT 風格的掩蓋預測會怎樣?困難在於音頻沒有自然詞彙,所以 HuBERT 自舉構建自己的——首先聚類 MFCC,然後迭代地重新聚類模型自身的隱藏狀態——並訓練 Transformer 在被掩蓋的幀上預測這些偽標籤。

回報是更清晰的目標,在 Librispeech 和 Libri-light 上,結果在從 Base 到 X-Large 的每個模型規模上都匹配或超越 wav2vec 2.0。這是來自 Meta AI 的深入探討,說明了 k-means 自舉循環、為什麼聲學單位從迭代中出現,以及相同的預訓練如何乾淨地轉移到 ASR、說話者識別和情感任務。HuBERT 後來成為 HuggingFace 上進行語音表示工作的任何人的默認起始點之一,所以如果您為下一個 ASR 或 SLU 項目選擇編碼器,花幾分鐘時間在這裡的直覺上將為您節省許多超參數猜測的時間。