[Long Review] CLAS: Deep context: end-to-end contextual speech recognition

Tutorials

[Long Review] CLAS: 깊은 문맥: 종단간 문맥적 음성 인식

ASR 제품을 출시한 사람이라면 누구나 고유명사의 고통을 알고 있습니다: 연락처 이름, 노래 제목, 약물 이름, 모호한 장소 이름.

ASR 제품을 출시한 사람이라면 누구나 고유명사의 고통을 알고 있습니다: 연락처 이름, 노래 제목, 약물 이름, 모호한 장소 이름. CLAS(또는 Contextual Listen-Attend-Spell)는 그 문맥을 종단간 음성 인식기에 직접 주입하기 위한 Google의 답변입니다. 사실 이후에 빔 검색을 편향시키는 대신, CLAS는 편향 구문 목록에 대한 주의 메커니즘을 학습하므로 모델은 재훈련 없이 디코딩 시간에 사용자 특정 어휘에 의존할 수 있습니다.

이 장문 리뷰는 아키텍처, 편향 주의를 주의산만에 견고하게 만드는 훈련 트릭, 그리고 현실적인 음성 보조 작업에서의 WER 승리를 분석합니다. 기기 내 ASR, 받아쓰기 앱, 또는 개인화가 중요한 음성 인터페이스를 구축하는 경우, CLAS는 수년 후에도 기초적인 읽음으로 남아 있으며 그 아이디어는 현대 RNN-T 및 CTC 문맥적 편향 작업에 계속 나타납니다. 문맥적 편향이 ASR 로드맵에 있다면 노트북을 열고 따라갑니다.