세쌍둥이처럼 닮은 러시아 피겨 스케이터들: Kullback-Leibler 발산이 그들의 차이를 구별할 수 있습니까?
스피커 적응은 시퀀스-투-시퀀스 모델을 인코더의 어렵게 획득한 음향 표현을 손상시키지 않고 적응시키려고 실제로 시도할 때까지 해결된 것처럼 들리는 ASR 문제 중 하나입니다.
스피커 적응은 시퀀스-투-시퀀스 모델을 인코더의 어렵게 획득한 음향 표현을 손상시키지 않고 적응시키려고 실제로 시도할 때까지 해결된 것처럼 들리는 ASR 문제 중 하나입니다. 이 토론은 거의 동일한 러시아 피겨 스케이터의 기억할 만한 프레임을 사용하여 KL 발산이 매우 유사한 스피커 분포를 구별할 수 있는지 묻고, "Listen, Attend, Spell and Adapt"를 살펴봅니다: 기본 모델을 유지하면서 경량의 스피커별 구성 요소를 학습하는 스피커 적응 seq2seq ASR 아키텍처입니다.
KL 정규화가 적응 중 치명적인 드리프트를 어떻게 방지하는지, 적응 데이터 예산이 WER 향상과 어떻게 트레이드오프되는지, 그리고 LAS 스타일 주의 인코더가 하이브리드 HMM 시스템에서와 다르게 적응 중에 어떻게 동작하는지에 대한 신중한 검토를 기대하십시오. 개인화된 음성 인터페이스, 음성 클로닝 스택, 또는 사용자별 음향 프로필이 있는 받아쓰기 제품을 구축하는 모든 사람을 위해, 여기의 아이디어들은 여전히 Conformer 및 트랜스듀서 기반 시스템에 직접 적용됩니다. 스피커 적응이 당신의 ASR 스택에서 단순한 호기심 이상이라면, 재생 버튼을 누르십시오.
