DeepMind的WaveNet用于TTS/音频合成的评述(看起来像GPT吗?)
在Tacotron之前,在VALL-E之前,在神经编解码器将音频转换为令牌之前,DeepMind的WaveNet是展示神经网络可以逐个样本生成原始音频波形并击败所有参数化和
在Tacotron之前,在VALL-E之前,在神经编解码器将音频转换为令牌之前,DeepMind的WaveNet是展示神经网络可以逐个样本生成原始音频波形并在自然性上击败所有参数和级联TTS系统的论文。现在用GPT的眼光看它,相似之处不可思议:一个完全概率性的自回归模型,根据所有先前的样本调节每个样本——音频的语言模型,比LLMs成为家喻户晓的术语早五年。
该评述介绍了16 kHz处使用的架构:扩张因果卷积以指数增长感受野、门控激活、残差和跳过连接。它还涵盖了WaveNet除TTS之外的演示——说话人调节以交换语音、作为副产品的音乐生成,甚至作为判别模型的竞争性音素识别。如果你想看到现代语音生成AI实际上从哪里开始的,以及为什么自回归令牌-音频范例在更新的TTS系统中不断回归,这个回顾是很好的基础。
