[Short Review] Wav2Seq: Pre-training Speech-to-Text Encoder-Decoder Models Using Pseudo Languages

Tutorials

[短評論] Wav2Seq:使用偽語言預訓練語音轉文本編碼器-解碼器模型

像wav2vec 2.0這樣的自監督預訓練給了我們很好的語音編碼器,但如果你想要一個完整的編碼器-解碼器ASR系統,解碼器仍然從零開始。

像wav2vec 2.0這樣的自監督預訓練給了我們很好的語音編碼器,但如果你想要一個完整的編碼器-解碼器ASR系統,解碼器仍然從零開始。Wav2Seq通過發明一種偽語言、源自語音特徵的離散簇ID,並預訓練整個seq2seq Transformer將音頻翻譯為它來修復此問題。

這篇短評論將Wav2Seq配方蒸餾為重要的部分,說明偽令牌的構造方式、為什麼得到的預訓練任務實際上有助於下游ASR和語音NLU,以及它如何與僅編碼器預訓練方法並存。包括了關於seq2seq注意力的快速更正。如果您正在評估低資源語音轉文本的預訓練策略,點擊播放即可觀看快速版本。