From OpenAI's Whisper Model to Your Own In-House ASR Service: Postprocessing and Language Modeling

Tutorials

OpenAIのWhisperモデルから自社ASRサービスまで:後処理と言語モデリング

生のWhisper出力は素晴らしいものですが、実際のユーザーにデプロイした経験がある人なら、デモトランスクリプトと下流システムが実際に利用できるもの間のギャップを知っています。

生のWhisper出力は素晴らしいものですが、実際のユーザーにデプロイした経験がある人なら、デモトランスクリプトと下流システムが実際に利用できるもの間のギャップを知っています。数字はスペルアウトされ、固有名詞は歪められ、句読点は一貫性がなく、ドメイン用語は最も近い音韻の推測として出ます。このWhisperから自社ASRシリーズの4番目のインストールメントは、そのギャップを埋める後処理と言語モデリング層に焦点を当てています。

ウォークスルーでは、逆テキスト正規化、句読点と大文字小文字の復元、カスタム語彙へのバイアス、およびWhisperのデコーダーで外部言語モデルをコンポーズする方法—浅いフュージョン、リスコアリング、プロンプト条件付きデコーディング間のトレードオフを含む—をカバーしています。また、素朴な修正が裏目に出る場所(過度なバイアスは一般的な精度を損なう、積極的なITNはタイムスタンプを破壊する)と、パイプラインを適切に評価する方法についても示しています。Whisperトランスクリプトのフォルダを見つめながら、WERは良好に見えるのに顧客の苦情が続く理由を考えている場合、この詳細な説明はあなたの時間の価値があります。