WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing

Tutorials

WavLM: 大規模自己教師あり事前学習による全スタック音声処理

ほとんどの音声SSLモデルはASRに最適化し、他のすべてがうまくいくことを望んでいます。

ほとんどの音声SSLモデルはASRに最適化し、他のすべてがうまくいくことを望んでいます。WavLMはMicrosoftから生まれており、反対の方法で構築されています—1度事前学習を行い、すべてを実行できます:認識、話者検証、話者分離、音声分離、完全なSUPERBベンチマーク。コツはトランスフォーマー内のゲートされた相対位置バイアスと事前学習中の発話混合であり、これはモデルに単なる音韻的表現ではなく話者対応とノイズに強い表現を学習させます。

結果は登場した時のSUPERBリーダーボードの完全制覇でした。特にHuBERTとwav2vec 2.0が十分に対応していない非ASRタスクで強力な利益を上げています。このセッションでは、発話混合が実際に訓練時にどのようなものかを説明し、位置バイアスがより長いコンテキストで重要な理由、そして94k時間の事前学習コーパスがどのように構築されたかについて説明します。すべての下流音声タスク用の個別エンコーダーの管理に疲れている場合、WavLMはHuggingFaceで今日利用可能な最も強力な単一バックボーン選択の1つです—この深掘りはキューに入れる価値があります。