为什么OpenAI Whisper生成的词时间戳不准确?如何再次使其准确?
向Whisper请求词时间戳,你会得到数字——但如果你曾经尝试将它们与实际音频对齐以进行卡拉OK、字幕或配音,你就知道它们漂移、卡在错误的边界上,有时会
向Whisper请求词时间戳,你会得到数字——但如果你曾经尝试将它们与实际音频对齐以进行卡拉OK、字幕或配音,你就知道它们漂移、卡在错误的边界上,有时会幻觉出不存在的断词。这次讲座在架构层面解释了为什么会这样,以及你实际上可以做什么。
简短版本:用交叉熵训练的端到端Transformer解码器被优化为预测下一个token,而不是在时间上对齐它。交叉注意力权重和基于DTW的技巧是建立在从未将对齐作为一等目标的模型之上的启发式方法。此演练然后调查提供的修复——启发式后处理工具(大多数未经基准测试且最好避免)、基于音素的强制对齐(更好但需要发音字典和额外计算)以及将Whisper的转录与CTC或强制对齐模型配对的混合方法。如果你正在发布任何时间重要的产品——字幕、配音、语音编辑、语音分析——这是在生产中信任Whisper时间戳前的必要背景。