SNRi目标训练用于联合语音增强和识别
联合训练语音增强和ASR听起来很明显——只需通过去噪器反向传播识别损失——但实际上很混乱,因为激进的去噪常常扭曲声学模型依赖的特征
联合训练语音增强和ASR听起来很明显——只需通过去噪器反向传播识别损失——但实际上很混乱,因为激进的去噪常常扭曲声学模型所依赖的特征。这篇NTT论文提出了一个更清洁的目标:与其增强到"清洁",不如增强到下游识别器实际偏好的目标信噪比,让模型学习在噪声失真权衡上的位置。
SNRi目标按话语进行估计,并用作增强网络的显式控制信号,使前端停止过度处理简单段而停止处理不足硬段。讲座涵盖了目标的推导方式、它如何集成到标准增强架构中,以及相比级联和vanilla联合训练基线所获得的CHiME风格基准增益。如果你正在将ASR部署到嘈杂的真实环境中——汽车、呼叫中心、可穿戴设备——这是一个微妙但强大的技巧,可以添加到你的管道中。
