マイクロソフトのVALL-E 2レビュー(ゼロショットTTSで人間レベルの性能を達成)
ゼロショットTTSは多くの人がまだ数年先だと考えていたレベルを越えました。マイクロソフトのVALL-E 2は、LibriSpeechとVCTKの両方で、ロバスト性、自然性、スピーカー
ゼロショットTTSは多くの人がまだ数年先だと考えていたレベルを越えました。マイクロソフトのVALL-E 2は、LibriSpeechとVCTKの両方で、ロバスト性、自然性、スピーカー類似度の全てにおいて人間レベルの性能を達成した初めてのニューラルコーデック言語モデルです。本レビューでは、チームがどのようにしてこれを実現したのかを詳しく解き明かし、元のVALL-Eの最大の失敗モード——ランナウェイデコーディングループと長い、複雑、または繰り返しの入力文での脆弱な出力——を静かに修正する2つの一見シンプルなアーキテクチャの調整に焦点を当てています。
コアとなる施策はRepetition Aware Samplingで、これはトークン繰り返し履歴を条件として核サンプリングを再形成し、デコーディングを安定化させ無限ループを排除します。もう1つはGrouped Code Modelingで、コーデックトークンをグループにチャンク化し、シーケンス長を削減し、推論を加速し、長シーケンスモデリングの課題に対処します。本レビューでは、本番環境のTTSを構築する際にこれらがなぜ重要かを説明します。従来は難しい文でも一貫して高い品質の出力、より強いスピーカー類似度、ALSや失語症で声を失った人の音声復元のようなアクセシビリティアプリケーションへの実現可能なパスが提供されます。コーデックLM、ニューラルボコーダー、またはゼロショット音声クローニングに取り組んでいる場合、本分析は論文に深く入る前に始める場所です。
