為什麼 OpenAI Whisper 生成的詞級時間戳不準確?如何讓它們再次準確?
向 Whisper 索取詞級時間戳,你會得到數字返回——但如果你曾經嘗試將它們與實際音頻對齐進行卡拉OK、字幕或配音,你就知道它們會漂移、對齐到錯誤的邊界,並偶爾
向 Whisper 索取詞級時間戳,你會得到數字返回——但如果你曾經嘗試將它們與實際音頻對齐進行卡拉OK、字幕或配音,你就知道它們會漂移、對齐到錯誤的邊界,並偶爾產生不存在的詞邊界幻覺。此演講在架構層面解釋了為什麼會發生這種情況,以及你實際上可以做什麼來解決它。
簡短版本:使用交叉熵訓練的端到端 Transformer 解碼器被優化為預測下一個 token,而不是在時間上對齐它。交叉注意力權重和基於 DTW 的技巧是建立在從未將對齐作為一級目標學習的模型之上的啟發式方法。演講隨後調查了可用的修復方案——啟發式後處理工具(大多未經基準測試且最好避免)、基於音素的強制對齐(更好,但需要發音字典和額外計算)以及將 Whisper 的轉錄與 CTC 或強制對齐模型配對的混合方法。如果你要發布任何時序很重要的產品——字幕、配音、語音編輯、語音分析——在生產環境中信任 Whisper 的時間戳之前,這是必需的背景信息。
