[短评] Wav2Seq:使用伪语言预训练语音到文本编码器-解码器模型
像wav2vec 2.0这样的自监督预训练给了我们很好的语音编码器,但如果您想要一个完整的编码器-解码器ASR系统,解码器仍然从零开始。
像wav2vec 2.0这样的自监督预训练给了我们很好的语音编码器,但如果您想要一个完整的编码器-解码器ASR系统,解码器仍然从零开始。Wav2Seq通过发明伪语言、从语音特征衍生的离散簇ID,以及预训练整个seq2seq Transformer将音频翻译为它来修复这个问题。
这篇短评将Wav2Seq配方提炼为重要的部分:伪令牌如何构建、为什么产生的预训练任务实际上有助于下游ASR和口语NLU、以及它如何与仅编码器的预训练方法相结合。包括对seq2seq注意力的快速更正。如果您正在评估低资源语音到文本的预训练策略,请点击播放快速版本。