Why word timestamps generated by OpenAI Whisper are not accurate? How to make them accurate again?

Tutorials

OpenAI Whisper가 생성한 단어 타임스탐프가 정확하지 않은 이유는? 다시 정확하게 만들 수 있을까?

Whisper에 단어 타임스탐프를 요청하면 숫자가 반환됩니다 — 하지만 실제 오디오와 맞춰보려고 시도한 경험이 있다면, 노래방, 자막, 더빙을 위해 드리프트가 발생하고 잘못된 경계로 스냅되며 가끔은

Whisper에 단어 타임스탐프를 요청하면 숫자가 반환됩니다 — 하지만 실제 오디오와 맞춰보려고 시도한 경험이 있다면, 노래방, 자막, 더빙을 위해 드리프트가 발생하고 잘못된 경계로 스냅되며 때때로 존재하지 않는 단어 구분을 환각합니다. 이 강연은 그런 일이 아키텍처 수준에서 왜 발생하는지, 그리고 실제로 무엇을 할 수 있는지 설명합니다.

요약하면: 교차 엔트로피로 훈련된 종단간 Transformer 디코더는 다음 토큰을 예측하도록 최적화되어 있지, 시간상으로 정렬하도록 최적화되어 있지 않습니다. 교차 어텐션 가중치와 DTW 기반 트릭은 정렬을 일등급 목표로 배운 적 없는 모델 위의 휴리스틱입니다. 이 안내는 제공되는 수정 사항들을 조사합니다 — 휴리스틱 후처리 도구(대부분 벤치마크되지 않았으며 피하는 것이 좋음), 음성 기반 강제 정렬(더 좋지만 발음 사전과 추가 연산이 필요함), 그리고 Whisper의 전사를 CTC 또는 강제 정렬 모델과 쌍으로 만드는 하이브리드 접근 방식. 타이밍이 중요한 제품을 출시하고 있다면 — 자막, 더빙, 음성 편집, 음성 분석 — Whisper의 타임스탐프를 프로덕션에서 신뢰하기 전에 이것이 필수 컨텍스트입니다.