[Olewave's Review] OpenAI's Whisper ASR: Robust Speech Recognition via Large-Scale Weak Supervision

Tutorials

[Olewave's Review] OpenAI's Whisper ASR: 大規模弱教師あり学習による堅牢な音声認識

OpenAIがWhisperをリリースしたとき、ASRコミュニティは680,000時間の多言語、マルチタスク、ウェブスクレイピングされたオーディオでトレーニングされたシステムと対峙する必要があり、このシステムはアクセント、背景ノイズ、および技術

OpenAIがWhisperをリリースしたとき、ASRコミュニティは680,000時間の多言語、マルチタスク、ウェブスクレイピングされたオーディオでトレーニングされたシステムと対峙する必要があり、このシステムはアクセント、背景ノイズ、および技術用語全体で箱から出してすぐに機能しました。このレビューは、WhisperがGPT-3がNLPに対して何をしたかを音声認識に対して行おうとしているかどうかを評価し、大規模弱教師あり学習が堅牢性のための強力なレシピとなる設計選択を詳しく説明しています。

このウォークスルーは、エンコーダ-デコーダTransformerアーキテクチャ、転写、翻訳、言語ID、および音声活動検出を単一のモデルに折り込むマルチタスク訓練フォーマット、およびWhisperを実質的にすべてのダウンストリーム音声プロジェクトの即座のベースラインに変えたオープンソース化された重みと推論コードをカバーしています。また、設計が行うトレードオフにも触れています:非自明な計算予算とバッチ指向の推論ストーリーと引き換えに、堅牢性と多言語性です。それでも自社のKaldi、ESPnet、またはNeMoパイプラインを実行しており、Whisperに交換するかどうか疑っている場合、またはスピーチファンデーションモデルを現在駆動しているデータとスケールのプレイブックを理解したい場合、次のアーキテクチャ決定の前にこれをキューに入れる価値があります。