VALL-E 深度評測:神經編解碼語言模型是零樣本文本轉語音合成器
從三秒參考音頻剪輯實現零樣本 TTS 曾聽起來不太可能,直到 VALL-E 推出,這篇深度評測正好揭示了 Microsoft 如何實現這一點。
從三秒參考音頻剪輯實現零樣本 TTS 曾聽起來不太可能,直到 VALL-E 推出,這篇深度評測正好揭示了 Microsoft 如何實現這一點。該模型將現成的神經音頻編解碼器作為 tokenizer,然後訓練一個語言模型來預測以文本和簡短演講者提示為條件的聲學 token。將合成重新構框為條件下一 token 預測而不是連續信號迴歸,是解鎖 in-context 說話者適應的概念樞紐。
該評測涵蓋了雙階段 autoregressive 加 non-autoregressive 解碼方案、60,000 小時 LibriLight 衍生的訓練語料庫,以及顯示 VALL-E 在自然度和說話者相似性上超越先前最先進水平的評估。它還涵蓋了令人驚訝的湧現行為:該模型從提示中保留了說話者的情感和錄音的聲學環境到輸出中。對於 TTS 工程師、語音克隆初創公司,以及任何權衡 codec-LM 方法與 diffusion 或 flow-matching 替代方案的人來說,這是參考演練。當你有時間進行完整架構導覽時,把它加入待看清單。
