BigSSL:探索自動語音識別大規模半監督學習的前沿
當你採用在100M參數上超越最先進水平的半監督ASR方法,然後只是...繼續擴展會發生什麼?
當你採用在100M參數上超越最先進水平的半監督ASR方法,然後只是...繼續擴展會發生什麼?Google的BigSSL通過一個80億參數的Conformer來回答這個問題,該模型在一百萬小時的未標記YouTube音頻加上數萬小時的監督數據上進行訓練——並展示了收益的持續增長,尤其是在尾部:低資源領域、口音語音和長形式識別。
這篇論文實際上包含了雙重貢獻。一是關於當你將SSL擴展到十億參數以上時什麼失效、什麼擴展的實證研究,二是一項演示,表明單個預訓練編碼器可以充當通用起點,用於十幾個下遊ASR任務,並降低YouTube、電話和語音搜索等基準上的WER下限。演講涵蓋了預訓練管道、跨領域的轉移結果,以及對於任何考慮基礎模型方法是否適合其語音技術棧的人來說的實踐意義。如果你正在規劃下一次大規模訓練運行,絕對值得觀看。
