One-Edit-Distance FSA/Network-based (OEDN)를 이용한 오발음 탐지 및 사투리 ASR
비원어민 음성 모델링은 닭과 계란 문제를 가지고 있습니다: 나쁜 음성 정렬은 나쁜 모델을 만들고, 나쁜 모델은 나쁜 정렬을 만듭니다.
비모국어 음향 모델링은 계란-닭 문제를 가지고 있습니다: 잘못된 음소 정렬은 잘못된 모델을 생성하고, 잘못된 모델은 잘못된 정렬을 생성합니다. 원편집거리 FSA/Network 기반 (OEDN) 접근법에 대한 이 이야기는 제약이 있는 음소 디코더를 사용하여 표준 발음의 원편집거리 내에서 가장 가능성 있는 발음된 수열을 인식한 후, 더 이상 발음 오류가 나타나지 않을 때까지 감지 및 인식을 반복함으로써 이 루프를 끊습니다.
300시간의 비모국어 자연 발화 말뭉치에서, 결과 음향 모델은 일치된 신경 위상을 가진 잘 튜닝된 문맥 의존 인수분해 TDNN HMM 기준선 대비 WER에서 6%를 깎아냈으며, 이는 그 규모에서 작지 않은 델타입니다. 정확도 향상을 넘어, 파이프라인은 비모국어 영어 학습자의 일반적인 발음 오류 패턴의 데이터 기반 카탈로그를 배출하며, 이는 음성 평가 및 발음 채점 제품에 직접 유용합니다. 이 이야기는 발음 우수성 점수가 초기 감지를 어떻게 주도하는지, 원편집거리 제약이 검색을 어떻게 추적 가능하게 유지하는지, 반복된 반복이 수렴할 때까지 정렬을 어떻게 계속 개선하는지를 설명합니다. 강세 있는 음성 ASR, 컴퓨터 보조 발음 훈련, 또는 사전이 당신을 거짓말하는 모든 음향 모델링 작업에서 작업하고 있다면, 구체적이고 재현 가능한 레시피를 보기 위해 재생을 누르세요.
