DiTARレビュー:音声生成のための拡散トランスフォーマーオートリグレッシブモデリング ~ Seed-TTS
Seed-TTSチームがDiTARで戻ってきました。これは現代の音声生成における最もぎこちないトレードオフの1つへのきれいな答えです:計算
Seed-TTSチームがDiTARで戻ってきました。これは現代の音声生成における最もぎこちないトレードオフの1つへのきれいな答えです:連続音声表現の柔軟性をどのように保つか。ハイブリッド拡散プラスオートリグレッシブスタックが通常要求する計算コストを支払わずに、そしてこれらの組み合わせが傾向のある準最適出力に満足することなく?DiTARは離散音声トークンを完全に回避し、言語モデルと拡散トランスフォーマーをペアにして連続オーディオを効率的に生成するパッチベースのフレームワークを使用します。
本レビューではモデルの中核にある分割統治のトリックを掘り下げます——LMは集約されたパッチ埋め込みを処理し、拡散トランスフォーマーに引き継ぎ、その出力を条件として次のパッチを生成します——さらに、温度を逆拡散ODEのノイズ注入ポイントとして再定義する素晴らしい推論時間ノブが、多様性と決定論の間をきれいに調整できます。広範なスケーリング分析、ロバスト性、スピーカー類似度、自然性に関するゼロショットベンチマークはすべてスコープ内にあり、DiTARは全範囲でSOTA性能を達成します。VALL-EとSeed-TTSの後、オートリグレッシブ音声生成がどこへ向かっているか追跡している場合、本深掘りはキューに入れる価値があります。
