[10 mins] Explain Why OpenAI's Whisper API Isn't As Good As ChatGPT

Tutorials

[10 分鐘] 解釋為什麼 OpenAI 的 Whisper API 不如 ChatGPT

Whisper 橫空出世,但它沒有像 GPT-3 改造 NLP 那樣重塑 ASR,這份十分鐘的評論認為原因都在論文本身。

Whisper 橫空出世,但它沒有像 GPT-3 改造 NLP 那樣重塑 ASR,這份十分鐘的評論認為原因都在論文本身。該模型在從網絡抓取的 680,000 小時多語言、多任務監督數據上進行了訓練,它確實提高了對口音、背景噪音和技術詞彙的魯棒性,同時還增加了英文翻譯功能。但與 ChatGPT 對文本的改造相比,這種進步只是增量式的。

該視頻深入探討了原因:來自網絡文字記錄的弱監督具有與乾淨標註數據不同的失敗模式,ASR 的上限受到聲學歧義的制約,這與下一個標記預測的方式不同,該模型的零樣本泛化不會像 LLMs 中的上下文學習那樣複合。對於任何決定是否微調 Whisper、採用 NeMo 或 ESPnet 模型,或等待下一代語音基礎模型的人來說,這裡的框架很有用。這是一個簡潔、有主見的分析,如果你在生產中部署 ASR,值得花五分鐘看一下。