XLS-R: Self supervised Cross lingual Speech Representation Learning at Scale

Tutorials

XLS-R:大規模自督導式跨語言語音表示學習

在水源乾涸之前,您能將跨語言語音預訓練推進多遠?

在水源乾涸之前,您能將跨語言語音預訓練推進多遠?Meta 的 XLS-R 用 20 億參數進行了回答,這些參數在 128 種語言的 436,000 小時未標記音頻上進行訓練——相比 XLSR-53 有數量級的跳躍,在發佈時,這是最大的公開多語言語音模型,領先幅度很大。

結果支持了規模故事。XLS-R 在 BABEL、CommonVoice 和 VoxPopuli 語音識別上創造了新的最先進技術,也許更令人驚訝的是,在英文語音翻譯上也是如此,在這方面它擊敗了以更大文本側模型構建的先前系統。本次講解介紹了這 128 種語言的數據策展、wav2vec 2.0 架構在 2B 參數下的表現,以及當您嘗試在低資源數據上微調這麼大的模型時會出現什麼問題。如果您在 HuggingFace 還未涵蓋的語言上進行任何語音任務,XLS-R 可能是您應該嘗試的第一個檢查點——深度探討解釋了原因。