从OpenAI的Whisper模型到自研ASR服务:后处理和语言建模
原始Whisper输出开箱即用,令人印象深刻,但任何真正将其交付给用户的人都知道演示转录和下游系统能实际使用的内容之间的差距。
原始Whisper输出开箱即用,令人印象深刻,但任何真正将其交付给用户的人都知道演示转录和下游系统能实际使用的内容之间的差距。数字被拼写为单词而非数字,专有名词被搞乱,标点符号不一致,领域术语以最接近的语音猜测出现。本系列的第四部分重点介绍了弥合这一差距的后处理和语言建模层。
该演练涵盖反向文本规范化、标点符号和大小写恢复、对自定义词汇的偏向,以及如何使用Whisper解码器组合外部语言模型——包括浅融合、重新评分和提示条件解码之间的权衡。它还指出朴素修复在哪些地方会反噬(过度偏向会降低总体准确性,激进的ITN会破坏时间戳)以及如何正确评估管道。如果您凝视着一个Whisper转录文件夹,想知道为什么WER看起来不错但客户投诉仍在继续,这项深入研究值得您花时间。
