評測 ByteDance/Tiktok 的 Seed-TTS:一系列高質量的通用語音生成模型
ByteDance 的 Seed-TTS 是迄今為止最強烈的信號之一,表明 TTS 正在從組件升級為真正的基礎模型。
ByteDance 的 Seed-TTS 是迄今為止最強烈的信號之一,表明 TTS 正在從組件升級為真正的基礎模型。這份評測介紹了整個系列——一個大規模自迴歸堆棧,在客觀和主觀評估中都達到了與地面真實人類語音基本無法區分的說話人相似度和自然性分數,以及一個完全基於擴散的非自迴歸同類產品叫 Seed-TTS_DiT,它完全跳過預估的音素時長,並通過端對端處理進行語音生成。微調將主觀分數提高得更高,對野生環境中說話人的情感和其他表現特徵具有強大的可控性。
除了頭條質量數字之外,有趣的部分是架構和方法論上的:一個用於語音分解的自蒸餾配方,讓你可以乾淨地解開屬性;以及一個強化學習微調循環,將穩健性、說話人相似度和可控性推向比僅監督訓練更遠的地方。DiT 變體還以舊 NAR 系統無法觸及的方式解鎖了語音編輯。如果你評估現代語音基礎模型看起來像什麼——用於語音克隆、表現合成、配音或上下文語音學習——花五分鐘看這份評測會快速為你定位。
