Review Microsoft's VALL-E 2 (Achieving Human Parity in Zero-shot TTS)

Tutorials

評測 Microsoft 的 VALL-E 2(在零樣本 TTS 中達到人類均等性)

零樣本 TTS 剛剛跨越了許多人認為還需要數年才能達到的界線:Microsoft 的 VALL-E 2 是首個在 LibriSpeech 和 VCTK 上同時達到人類均等性的神經編解碼語言模型,涵蓋穩健性、自然性和說話人

零樣本 TTS 剛剛跨越了許多人認為還需要數年才能達到的界線:Microsoft 的 VALL-E 2 是首個在 LibriSpeech 和 VCTK 上同時達到人類均等性的神經編解碼語言模型,涵蓋穩健性、自然性和說話人相似度。這份詳細的評測解析了團隊如何達成這一目標,重點是兩個看似簡單的架構調整,它們悄悄修復了原始 VALL-E 的最大故障模式——失控的解碼迴圈和在長、複雜或重複輸入句子上的脆弱輸出,這些曾經破壞該模型。

核心舉措是 Repetition Aware Sampling,它通過根據令牌重複歷史進行條件化來重塑核採樣,以穩定解碼並消除無限迴圈;以及 Grouped Code Modeling,它將編解碼令牌分組以縮短序列長度、加快推理速度並解決長序列建模的挑戰。該評測詳述了這些對於任何構建生產級 TTS 的人為什麼重要:即使在傳統上困難的句子上也能獲得始終更高品質的輸出、更強的說話人相似度,以及通往可訪問性應用程序的可行路徑,例如為患有 ALS 或失語症的人恢復語音。如果你從事編解碼 LM、神經聲碼器或零樣本語音克隆工作,這份詳細分析是在深入研究論文之前的起點。