Google 的通用語音模型在 100+ 語言上擊敗 OpenAI 的 Whisper 模型
Google 的通用語音模型悄悄做了一件非凡的事:在 100+ 語言上的 ASR 方面與 OpenAI 的 Whisper 相當或超越,同時使用大約七分之一的標記訓練資料。
Google 的通用語音模型悄悄做了一件非凡的事:在 100+ 語言上的 ASR 方面與 OpenAI 的 Whisper 相當或超越,同時使用大約七分之一的標記訓練資料。本次評論深入探討了他們如何做到這一點——而答案不只是更多計算。USM 依賴於跨越超過 300 種語言的龐大 1200 萬小時無標籤多語言資料集,然後使用隨機投影量化進行自監督編碼器預訓練,加上語音文本模態匹配以順利過渡到更小標籤集上的監督微調。
本次說明涵蓋了完整的預訓練配方,為什麼 RPQ 作為 SSL 目標的輕量級量化器無需學習碼本就有效,以及模態匹配如何在不需要網路規模成對資料的情況下對齐語音和文本表示。結果是單一編碼器,能夠泛化到下游多語言 ASR 和語音到文本翻譯,跨越低資源語言的長尾,包括域內和域外,這正是 Whisper 的完全監督方法開始吃力的地方。如果你的產品需要服務超過前 20 種語言的用戶,這是在確認多語言語音堆棧前值得理解的模型架構。
