評測 DiTAR:用於語音生成的擴散 Transformer 自迴歸建模 ~ Seed-TTS
Seed-TTS 團隊帶著 DiTAR 回來了,這是對現代語音生成中最尷尬的權衡之一的乾淨答案:你如何在保持連續語音表示的靈活性而不支付計算
Seed-TTS 團隊帶著 DiTAR 回來了,這是對現代語音生成中最尷尬的權衡之一的乾淨答案:你如何在保持連續語音表示的靈活性而不支付混合擴散加自迴歸堆棧通常需要的計算稅,以及不接受那些組合往往產生的次優輸出的情況下?DiTAR 完全迴避了離散語音令牌,使用一個基於補丁的框架,將語言模型與擴散 Transformer 配對以高效地生成連續音頻。
該評測深入探討了模型核心的分治技巧——LM 處理聚合的補丁嵌入並將其遞交給擴散 Transformer 以生成基於該輸出的下一個補丁——加上一個巧妙的推理時旋鈕,將溫度重新定義為反向擴散 ODE 中的噪聲注入點,給你在多樣性和決定論之間的乾淨撥號盤。廣泛的擴展分析、針對穩健性、說話人相似度和自然性的零樣本基準都在範圍內,DiTAR 在各個方面都發布了 SOTA 數字。如果你追蹤自迴歸語音生成在 VALL-E 和 Seed-TTS 之後的發展方向,這份深度分析值得列入隊列。
