[长评] 从说话人验证迁移学习到多说话人Text-To-Speech合成
这是使零样本声音克隆实用化的论文:在具有数千个嘈杂、无转录的声音上训练说话人编码器以进行判别验证任务,然后将这些嵌入馈送到Tacotron 2 s
这是使零样本声音克隆实用化的论文:在具有数千个嘈杂、无转录的声音上训练说话人编码器以进行判别验证任务,然后将这些嵌入馈送到Tacotron 2合成器和WaveNet声码器。结果是一个TTS系统,可以从几秒的参考音频模仿新的说话人,甚至是训练期间从未见过的说话人。
这篇关于来自Google的Jia等人工作的长评详细介绍了所有三个模块,基于验证目标训练的说话人编码器,受嵌入条件化的序列到序列mel频谱图合成器,以及自回归WaveNet声码器。它还深入探讨了量化在编码器中需要多少说话人多样性来泛化的消融研究,以及随机采样的嵌入产生连贯新声音的令人惊讶的结果。如果您在声音克隆、个性化TTS或说话人嵌入领域构建任何东西,此论文是必读的,深度分析涵盖了每一部分。
