From OpenAI's Whisper Model to Your Own In-House ASR Service: Overview (Part 1)

Tutorials

從 OpenAI 的 Whisper 模型到自研 ASR 服務:概述(第一部分)

當 OpenAI 開源 Whisper 時,它無聲地重置了自研 ASR 服務外觀的基準。

當 OpenAI 開源 Whisper 時,它無聲地重置了自研 ASR 服務外觀的基準。在自己的領域上微調強大的多語言基礎模型不再是登月計劃——如果你知道要拉動哪些槓桿,這是一個週末專案。本系列的第一部分列出了從 Whisper 檢查點到針對你的語言、口音和詞彙調整的生產 ASR 端點的完整路徑。

概述將問題分為三個部分。計算:來自 OpenAI 和 Microsoft 的自動微調服務與租用 GPU 相對於運行自己的集群。數據:大規模弱標記領域音訊與較小的生產樣本池配對,而不是經典的全乾淨工作室錄音方法。算法和部署:PEFT 配方和現有服務堆棧已經足夠好,你不應該從頭開始編寫自己的。本系列的其餘部分深入研究每個部分,但如果你想先了解心智模型,這個概述是正確的入口點。