공동 음성 개선 및 인식을 위한 SNRi 목표 훈련
음성 개선 및 ASR의 공동 훈련은 분명해 보입니다. 노이즈 제거기를 통해 인식 손실을 역전파하면 됩니다. 하지만 실제로는 공격적인 노이즈 제거가 음향 모델이 의존하는 기능을 자주 왜곡하기 때문에 복잡합니다.
음성 개선 및 ASR의 공동 훈련은 분명해 보입니다. 노이즈 제거기를 통해 인식 손실을 역전파하면 됩니다. 하지만 실제로는 공격적인 노이즈 제거가 음향 모델이 의존하는 기능을 자주 왜곡하기 때문에 복잡합니다. 이 NTT 논문은 더 깨끗한 목표를 제안합니다: "깨끗한"으로 개선하는 대신, 다운스트림 인식기가 실제로 선호하는 목표 신호 대 잡음 비율로 개선하고, 모델이 노이즈-왜곡 트레이드오프에서 어디에 앉을지를 배우도록 합니다.
SNRi 목표는 발화당 추정되고 개선 네트워크에 대한 명시적 제어 신호로 사용되므로, 프론트엔드는 쉬운 세그먼트를 과도하게 처리하는 것을 중지하고 어려운 세그먼트를 과소 처리하는 것을 중지합니다. 이 연습은 목표가 어떻게 도출되는지, 표준 개선 아키텍처에 어떻게 연결되는지, 그리고 계단식 및 기본 공동 훈련 기준선 모두에 대해 제공되는 CHiME 스타일 벤치마크 이득을 다룹니다. ASR을 시끄러운 현실 환경 - 자동차, 콜 센터, 웨어러블 기기로 배포하는 경우, 이것은 파이프라인에 추가할 미묘하지만 강력한 트릭입니다.
