3分でMicrosoftのVALL-Eを理解する(最先端ゼロショットTTS)
VALL-Eは、TTSが信号回帰ではなく言語モデリングのように見え始めた瞬間です。このクイック説明は、あなたを素早く最新の状態にします。
VALL-Eは、TTSが信号回帰ではなく言語モデリングのように見え始めた瞬間です。このクイック説明は、あなたを素早く最新の状態にします。Microsoftは既成のコーデックによって生成された離散オーディオトークンでニューラルコーデック言語モデルを訓練し、学習データを60,000時間の英語音声にスケールし、テキスト音声合成を条件付きの次トークン予測として再フレーミングしました。結果は、3秒間の音響プロンプトから未見のスピーカーをクローンするモデルで、最先端の自然性とスピーカー類似性を持っています。
より深い物語は、オーディオドメインでの文脈内学習の出現です。VALL-Eはスピーカーの感情とプロンプトの音響環境さえも保持しています。これは古い連結型およびニューラルTTSシステムがこの品質でマッチできない振る舞いです。音声クローニング、ダビング、またはパーソナライズされたアシスタントを提供している誰もが、これは地図を再描画した論文です。その後のコーデック-LM TTS波のきっかけになりました。3分あって、完全な論文なしでコア直感が欲しければ、再生を押してください。
