OpenAIのWhisperモデルから自社ASRサービスまで:概要(パート1)
OpenAIがWhisperをオープンソース化したとき、それは静かに自社ASRサービスが何のようなものであるかのベースラインをリセットしました。
OpenAIがWhisperをオープンソース化したとき、それは静かに自社ASRサービスが何のようなものであるかのベースラインをリセットしました。独自のドメインで強力な多言語基盤モデルを微調整することは、もはや月世界の試みではありません—どのレバーを引くかを知っていれば、週末のプロジェクトです。このシリーズの最初のインストールメントは、Whisperチェックポイントから本番ASRエンドポイントまでの完全なパスを、言語、アクセント、および語彙に調整して示しています。
この概要は、問題を3つのバケットに分けています。コンピュート:OpenAIおよびMicrosoftからの自動微調整サービス対GPUのレンタル対独自クラスタの実行。データ:古典的なすべてクリーンスタジオ録音アプローチではなく、大規模な弱くラベル付けされたドメインオーディオと、より小さなプールのよくラベル付けされた本番サンプルのペア。アルゴリズムとデプロイメント:PEFTレシピと既存のサービングスタックは、すでに十分に優れているため、最初からあなた自身を書く必要がありません。シリーズの残りの部分は各部分にドリルしていますが、最初にメンタルモデルが必要な場合、この概要は正しいエントリーポイントです。
