In-depth Review of Google's SoundStream: An End-to-End Neural Audio Codec

Tutorials

Google的SoundStream深度评述:端到端神经音频编解码器

神经编解码器悄悄成为现代生成音频的基础层,SoundStream是让这一切开始的论文之一。

神经编解码器悄悄成为现代生成音频的基础层,SoundStream是让这一切开始的论文之一。Google的端到端设计将完全卷积编码器/解码器与残差向量量化器配对,所有这些都用借自TTS和语音增强世界的对抗和重建损失联合训练。主要结果是惊人的:在3 kbps,SoundStream在12 kbps下击败Opus,并在24 kHz音频上接近9.6 kbps的EVS,跨越语音、音乐和一般声音。

除了压缩数字外,设计选择对任何运送语音技术的人都很重要。跨量化器层的结构化丢弃允许单个模型在不重新训练的情况下跨越3-18 kbps,该架构在具有可流式推理的智能手机CPU上实时运行。该论文还将背景噪声抑制直接折叠到编解码器中,位于编码器或解码器侧,没有增加延迟。如果你正在处理神经TTS令牌、低比特率呼叫或设备上音频管道,这个演练是对后来支持AudioLM及其后代的想法的坚实基础。点击播放以查看架构分解和主观评估结果。