[ショート レビュー] Wav2Seq: 疑似言語を使用した音声テキスト変換エンコーダーデコーダーモデルの事前訓練
wav2vec 2.0のような自己教師あり事前訓練により、素晴らしい音声エンコーダーが得られました。しかし、完全なエンコーダーデコーダーASRシステムが欲しい場合、デコーダーはまだゼロから開始していました。
wav2vec 2.0のような自己教師あり事前訓練により、素晴らしい音声エンコーダーが得られました。しかし、完全なエンコーダーデコーダーASRシステムが欲しい場合、デコーダーはまだゼロから開始していました。Wav2Seqはこれを疑似言語を発明することで修正します。離散クラスタID(音声機能から導出)であり、系列対系列Transformerモデル全体をオーディオからそれへ変換するように事前訓練します。
このショートレビューはWav2Seqレシピを重要な部分に凝縮しています。疑似トークンがどのように構築されるか、なぜ結果として得られた事前訓練タスクが実際に下流のASRおよび音声NLUを支援するのか、そしてそれがエンコーダーのみの事前訓練アプローチとどのように適合するかについてです。系列対系列の注意についての簡潔な訂正が含まれています。低リソース音声テキスト変換の事前訓練戦略を評価している場合は、高速版については再生ボタンをクリックしてください。
