SpeechT5评述:将Google的T5引入语音(ASR、TTS、SID...)任务
T5在单个编码器-解码器预训练方案下统一了文本到文本任务,并成为NLP的主力工具。
T5在单个编码器-解码器预训练方案下统一了文本到文本任务,并成为NLP的主力工具。SpeechT5提出了显而易见的后续问题:相同的技巧能否统一语音任务?来自Microsoft Research的答案基本上是肯定的。一个共享的编码器-解码器被六个模态特定的预网络和后网络包装起来,因此相同的核心网络可以消费语音或文本并输出语音或文本——从一个预训练检查点启用ASR、TTS、语音转换、语音翻译、语音增强和说话人识别。
该评述介绍了跨模态向量量化技巧,该技巧将语音和文本对齐到共享的潜在空间,以及为什么这种对齐实际上使一个模型能够在如此不同的任务中泛化。它还涵盖了SpeechT5在每个下游基准上的表现,以及统一方法仍然落后于单任务专家的地方。如果你正在考虑多任务语音基础模型——或者你想看到一个早期的、简洁的设计模式示例,这种模式后来出现在Voicebox和SeamlessM4T中——这个评述是一个坚实的基础。
