OpenAI Whisperが生成した単語タイムスタンプが正確でない理由は?再度正確にする方法は?
Whisperに単語タイムスタンプを要求すると数字が返ってくる — しかし、実際の音声にカラオケ、キャプション、またはダビング用にそれを並べてみようとしたことがあれば、ドリフト、間違った境界へのスナップ、そして時々
Whisperに単語タイムスタンプを要求すると数字が返ってくる — しかし、実際の音声にカラオケ、キャプション、またはダビング用にそれを並べてみようとしたことがあれば、ドリフト、間違った境界へのスナップ、そして時々存在しない単語の切れ目を幻覚することを知っているでしょう。このトークでは、それがアーキテクチャレベルでなぜ起こるのか、そしてあなたが現実的にそれについて何ができるのかについて説明します。
短版:交差エントロピーで訓練されたエンドツーエンドのTransformerデコーダは、時間内に調整するのではなく、次のトークンを予測するために最適化されています。交差注意の重みとDTWベースのトリックは、調整を第一級の目的として学習したことのないモデルの上のヒューリスティックです。ウォークスルーは、その後、提供されている修正を調査します — ヒューリスティックな後処理ツール(ほとんどベンチマークなしで、最良の場合は回避)、電話ベースの強制調整(より良いが、発音辞書と追加の計算が必要)、およびWhisperのトランスクリプトをCTCまたは強制調整モデルとペアにするハイブリッドアプローチ。字幕、ダビング、音声編集、音声分析など、タイミングが重要なあらゆる製品を出荷している場合、これは本番環境でWhisperのタイムスタンプを信頼する前に必要なコンテキストです。
