Non Collision Mispronunciation Addition (NCMA) for Accented ASR

Tutorials

Non Collision Mispronunciation Addition (NCMA) for 사투리 ASR

사투리와 비원어민 음성은 발음 사전을 파괴하여 음성 모델 정렬을 조용히 오염시키는데, 이 Interspeech 2021 작업은 기만적으로 단순한 질문을 던집니다: 우리가 탐지된 오발음을 단순히 사전에 추가하면

강세 음성과 비모국어 음성은 발음 사전을 훼손하는 방식으로 음향 모델 정렬을 조용히 손상시키며, 이 Interspeech 2021 연구는 기만적으로 단순한 질문을 제시합니다: 검출된 발음 오류를 단순히 사전에 추가하고 재훈련하면 어떨까요? 비충돌 발음 오류 추가 (NCMA)는 Interspeech 2021 비모국어 아동 영어 밀폐 과제 ASR 챌린지에 대한 PAII의 제출 기법이며, 어린이 음성, L2 학습자, 강세 있는 성인 음성이 프로덕션 ASR에 야기하는 WER 문제를 정면으로 겨냥합니다.

이 발표는 NCMA가 어휘에 새로운 발음을 주입할 때 충돌을 회피하는 방식, 더 나은 음소 정렬이 더 강력한 음향 모델로 어떻게 피드백되는지, 그리고 전체 검출-추가-재정렬 루프가 진정으로 어려운 벤치마크에서 측정 가능한 WER 감소로 어떻게 전환되는지를 설명합니다. 이 기법은 Interspeech 2021에서 W. Chu, P. Chang, J. Xiao에 의해 발표된 논문에 근거하며, 이 발표는 알고리즘 선택을 이를 동기부여한 챌린지 제출에 연결합니다. 교육용 ASR, 아동 제품, 컴퓨터 보조 언어 학습, 또는 일반 사전이 조용히 실패하는 강세 있는 화자의 롱테일을 구축하고 있다면, 목표 지정 어휘 복구가 무차별적 데이터 수집을 어떻게 이기는지 보기 위해 시간을 투자할 가치가 있습니다.