OpenAIのWhisperモデルから自社ASRサービスまで:長いオーディオとストリーミング(パート3)
Whisperは30秒のチャンクで訓練されており、2時間のポッドキャストをフィードするか、ライブキャプショニングパイプラインにワイアリングしようとする瞬間に見せています。
Whisperは30秒のチャンクで訓練されており、2時間のポッドキャストをフィードするか、ライブキャプショニングパイプラインにワイアリングしようとする瞬間に見せています。幻覚的な繰り返し、サイレントセグメントドリフト、オーディオ長とともにスパイクするレイテンシーは、すべて同じ根本的な制限の症状です—モデルは長編またはストリーミング用に最初から構築されていませんでした。このWhisperデプロイメントシリーズのパート3は、両方の問題に真っ向から取り組みます。
このセグメントは、長いオーディオ推論のための実用的な戦略をウォークスルーします:VADベースのチャンキング、境界アーティファクトを避けるための重複とステッチ、コンテキストを流し続けるための前ウィンドウテキストをデコーダープロンプトとして使用します。ストリーミング側では、先読み付きのチャンキングデコーディング、レイテンシーと安定性のトレードオフの調整、およびコミュニティのストリーミングWhisperフォーク(whisper-streaming やfaster-whisperなど)が実際に役立つ場所と、まだカスタムグルーが必要な場所をカバーしています。ライブキャプション、ミーティングボット、またはWhisperの受容野より長いオーディオをトランスクライブする必要があるその他の製品を構築している場合、これはシリーズの再生すべき部分です。
