HiFi-GAN评述:用于高效和高保真语音合成的生成对抗网络
长期以来,神经声码器迫使你选择一方:像WaveNet这样的自回归模型给你华丽的音频但速度缓慢,而基于GAN的波形生成器很快但质量明显较低。
长期以来,神经声码器迫使你选择一方:像WaveNet这样的自回归模型给你华丽的音频但速度缓慢,而基于GAN的波形生成器很快但质量明显较低。HiFi-GAN弥合了这一差距。它在单个V100上以167.9倍实时速度生成22.05 kHz音频,达到人类录音范围内的平均意见得分,并成为现代TTS堆栈很大一部分的默认声码器。
该评述关注使其工作的设计洞察:语音是许多不同周期的正弦波之和,因此判别器需要明确地查看这些周期。HiFi-GAN的多周期判别器(与多尺度判别器配对)是在生成器保持精简的同时提高保真度的原因。该演练还涵盖了它对未见说话人的mel频谱图反演的泛化程度、其端到端TTS行为,以及在CPU上以13.4倍实时速度运行的小足迹变体。如果你在2024年为TTS产品选择声码器,并想理解为什么HiFi-GAN仍然是合理的默认选择,这个声码器回顾值得你关注。
