[Olewave的评论] OpenAI的Whisper ASR:通过大规模弱监督实现鲁棒语音识别
当OpenAI发布Whisper时,ASR社区不得不面对一个在680,000小时的多语言、多任务、网络爬取音频上训练的系统,该系统在口音、背景噪音和技术方面开箱即用
当OpenAI发布Whisper时,ASR社区不得不面对一个在680,000小时的多语言、多任务、网络爬取音频上训练的系统,该系统在口音、背景噪音和技术术语方面开箱即用。本评论评估了Whisper是否会对语音识别做GPT-3对NLP所做的事情,并解释了使大规模弱监督成为如此强大的鲁棒性配方的设计选择。
演示文稿涵盖了编码器-解码器Transformer架构、将转录、翻译、语言ID和语音活动检测折叠为单一模型的多任务训练格式,以及将Whisper变成几乎所有下游语音项目即时基线的开源权重和推理代码。它还涉及设计所做的权衡:鲁棒性和多语言性,代价是非平凡的计算预算和面向批处理的推理方案。如果你仍在运行自研的Kaldi、ESPnet或NeMo管道,并想知道是否要换成Whisper,或者你想了解现在驱动语音基础模型的数据和规模战略,这个值得在下一个架构决策之前排队观看。
