[Short Review] Wav2Seq: Pre-training Speech-to-Text Encoder-Decoder Models Using Pseudo Languages

Tutorials

[ショート レビュー] Wav2Seq: 疑似言語を使用した音声テキスト変換エンコーダーデコーダーモデルの事前訓練

wav2vec 2.0のような自己教師あり事前訓練により、素晴らしい音声エンコーダーが得られました。しかし、完全なエンコーダーデコーダーASRシステムが欲しい場合、デコーダーはまだゼロから開始していました。

wav2vec 2.0のような自己教師あり事前訓練により、素晴らしい音声エンコーダーが得られました。しかし、完全なエンコーダーデコーダーASRシステムが欲しい場合、デコーダーはまだゼロから開始していました。Wav2Seqはこれを疑似言語を発明することで修正します。離散クラスタID(音声機能から導出)であり、系列対系列Transformerモデル全体をオーディオからそれへ変換するように事前訓練します。

このショートレビューはWav2Seqレシピを重要な部分に凝縮しています。疑似トークンがどのように構築されるか、なぜ結果として得られた事前訓練タスクが実際に下流のASRおよび音声NLUを支援するのか、そしてそれがエンコーダーのみの事前訓練アプローチとどのように適合するかについてです。系列対系列の注意についての簡潔な訂正が含まれています。低リソース音声テキスト変換の事前訓練戦略を評価している場合は、高速版については再生ボタンをクリックしてください。