XLS-R: Self supervised Cross lingual Speech Representation Learning at Scale

Tutorials

XLS-R: 大規模クロスリンガル音声表現学習の自己教師あり学習

クロスリンガル音声事前学習をどこまで拡大できるのか、限界に達するまで?

クロスリンガル音声事前学習をどこまで拡大できるのか、限界に達するまで?MetaのXLS-Rは20億パラメータで回答し、128言語にわたる436,000時間のラベルなしオーディオで訓練されました—XLSR-53に対する桁違いの進歩であり、リリース時には公開多言語音声モデルとして圧倒的に最大です。

結果はスケール報告を支持しています。XLS-RはBABEL、CommonVoice、VoxPopuli音声認識で新しい最先端を設定し、おそらく驚くべきことに英語への音声翻訳でも、はるかに大きなテキスト側モデルで構築された以前のシステムを上回ります。この講演では、128言語にわたるデータキュレーション、2Bパラメータでwav2vec 2.0アーキテクチャがどのように持ちこたえるか、そして低リソースデータでこのような大規模なものを微調整する際に何が失敗するかについて説明します。HuggingFaceが既にカバーしていない言語で音声タスクに取り組んでいる場合、XLS-Rはおそらくまず試すべきチェックポイントです—この深掘りはそれがなぜかを説明しています。