[Long Review] Wav2Seq: Pre-training Speech-to-Text Encoder-Decoder Models Using Pseudo Languages

Tutorials

[ロング レビュー] Wav2Seq: 疑似言語を使用した音声テキスト変換エンコーダーデコーダーモデルの事前訓練

ほとんどの音声事前訓練はエンコーダー側に焦点を当てています。wav2vec、HuBERT、WavLMですが、系列対系列ASRは事前訓練されたデコーダーも必要です。

ほとんどの音声事前訓練はエンコーダー側に焦点を当てています。wav2vec、HuBERT、WavLMですが、系列対系列ASRは事前訓練されたデコーダーも必要です。Wav2Seqはこのギャップを巧妙なトリックで埋めます。音声表現を離散的な疑似トークンにクラスタリングし、それらのトークンを合成「疑似言語」として扱い、音声をそれに翻訳するための完全なエンコーダーデコーダーTransformerを事前訓練します。

このロングフォームレビューはWav2Seqパイプラインについて詳しく解説しています。疑似言語がどのように構築されるか、なぜそれを実際の翻訳ターゲットとして扱うことがデコーダーに有用なスキルを学ばせるのか、事前訓練されたモデルが下流のASRおよび音声言語理解タスクにどのように転移するかについてです。系列対系列モジュールの注意についての訂正が含まれています。低リソースASR、カスケード音声テキスト変換、またはエンコーダーを超えた自己教師あり事前訓練からさらに多くを引き出そうとしている場合、詳細な解説がすべての理解する価値のある設計選択肢をカバーしています。