[Olewave的評論] OpenAI的Whisper ASR:通過大規模弱監督進行強大的語音識別
當OpenAI推出Whisper時,ASR社區不得不面對一個在680,000小時多語言、多任務、網絡爬取音頻上訓練的系統,該系統開箱即用,跨越口音、背景噪音和技術
當OpenAI推出Whisper時,ASR社區不得不面對一個在680,000小時多語言、多任務、網絡爬取音頻上訓練的系統,該系統開箱即用,跨越口音、背景噪音和技術術語。本評論判斷Whisper是否會對語音識別做GPT-3對NLP所做的事,並解析使大規模弱監督成為強大魯棒性配方的設計選擇。
本演練涵蓋了編碼器-解碼器Transformer架構、將轉錄、翻譯、語言ID和語音活動檢測納入單個模型的多任務訓練格式,以及開源權重和推理代碼,使Whisper成為幾乎每個下游語音項目的即時基線。它還討論了設計的權衡:用可觀的計算預算和面向批次的推理方式換取魯棒性和多語言性。如果您仍在運行自研的Kaldi、ESPnet或NeMo管道,並想知道是否應該換成Whisper,或者想了解現在驅動語音基礎模型的數據和規模策略,這個內容值得在您做下一個架構決策之前觀看。
