三分钟了解微软 VALL-E(SOTA 零样本 TTS)
VALL-E 是 TTS 从信号回归转变为语言建模的转折点,这个快速解释器能让你快速掌握核心概念。
VALL-E 是 TTS 从信号回归转变为语言建模的转折点,这个快速解释器能让你快速掌握核心概念。微软在现成编解码器生成的离散音频令牌上训练了神经编解码语言模型,将训练数据扩展至 60,000 小时英语语音,并将文本转语音重新框架化为条件下一标记预测。所得模型能够从三秒音频参考中克隆未见过的讲话者,具有最先进的自然度和讲话者相似度。
更深层的故事是音频领域中上下文学习的出现。VALL-E 保留讲话者的情感,甚至保留了参考音频的声学环境,这是旧的拼接式和神经 TTS 系统无法达到的质量。对于任何开发语音克隆、配音或个性化助手的人来说,这就是改写了行业版图的论文,它开启了随后编解码器-LM TTS 的浪潮。如果你有三分钟时间,想要了解核心思想而无需阅读完整论文,就点击播放。