BigSSL: Exploring the Frontier of Large-Scale Semi-Supervised Learning for Automatic Speech Recog

Tutorials

BigSSL: 自動音声認識のための大規模半教師あり学習の最前線を探索

1億パラメータで最先端を打ち破った半教師あり音声認識レシピを取って、単にスケーリングを続けたらどうなるか?

1億パラメータで最先端を打ち破った半教師あり音声認識レシピを取って、単にスケーリングを続けたらどうなるか?GoogleのBigSSLは、100万時間のラベルなしYouTubeオーディオで学習した80億パラメータのConformerで答える。さらに数万時間の教師あり学習データがあり、特に尾部での改善が継続することを示す。低リソース領域、アクセント付き音声、長形式認識がそれだ。

この論文は本当に1つの中の2つの貢献である。SSLを10億パラメータを超えて推し進めるときに何が壊れ、何がスケールするかの経験的研究である。また、単一の事前学習されたエンコーダーが12のダウンストリームASRタスクの汎用的な開始点として機能でき、YouTube、電話通信、音声検索ベンチマークのWERフロアを削減できることの実証である。このトークでは、事前学習パイプライン、ドメイン全体の転送結果、そしてファウンデーションモデルのアプローチが音声スタックに対して理にかなっているかどうかを検討している人にとっての実用的な意味合いをカバーしている。大規模でのスケーリング時に次の学習実行を計画しているなら、キューに入れる価値がある。