OpenAI의 Whisper 모델에서 자신의 자체 ASR 서비스로: 후처리 및 언어 모델링
원본 Whisper 출력은 기본 상태에서 인상적이지만, 실제 사용자에게 배포한 모든 사람은 데모 트랜스크립트와 다운스트림 시스템이 실제로 사용할 수 있는 것 사이의 간격을 알고 있습니다.
원본 Whisper 출력은 기본 상태에서 인상적이지만, 실제 사용자에게 배포한 모든 사람은 데모 트랜스크립트와 다운스트림 시스템이 실제로 사용할 수 있는 것 사이의 간격을 알고 있습니다. 숫자는 자릿수 대신 단어로 표기되고, 고유명사는 왜곡되고, 구두점은 일치하지 않으며, 도메인 전문 용어는 가장 가까운 음성 추측으로 나타납니다. Whisper-to-자체-ASR 시리즈의 네 번째 편은 이 간격을 메우는 후처리 및 언어 모델링 레이어에 초점을 맞춥니다.
이 안내서는 역 텍스트 정규화, 구두점 및 대소문자 복원, 사용자 정의 어휘로의 편향, Whisper 디코더와의 외부 언어 모델 구성 방법을 다룹니다 — 얕은 융합, 재점수 매기기, 프롬프트 조건부 디코딩 간의 트레이드오프 포함. 순진한 수정이 역효과를 낼 수 있는 경우(과도한 편향은 일반적인 정확도를 해치고, 공격적인 ITN은 타임스탬프를 손상시킴)와 파이프라인을 올바르게 평가하는 방법을 지적합니다. Whisper 트랜스크립트 폴더를 보면서 WER이 좋아 보이는데 고객 불만이 계속 들어오는 이유를 궁금해하고 있다면, 깊이 있는 설명은 시간을 투자할 가치가 있습니다.
