三分鐘了解 Microsoft 的 VALL-E(SOTA 零樣本 TTS)

Tutorials

三分鐘了解 Microsoft 的 VALL-E(SOTA 零樣本 TTS)

VALL-E 是 TTS 停止像信號迴歸一樣發展、開始像語言建模一樣發展的時刻,這個快速講解器能讓你快速上手。

VALL-E 標誌著 TTS 停止像信號迴歸一樣發展、開始像語言建模一樣發展的時刻,這個快速講解器能讓你快速上手。Microsoft 在現成編解碼器產生的離散音頻 token 上訓練了神經編解碼語言模型,將訓練數據擴展至 60,000 小時的英語語音,並將文本轉語音重新定義為條件下一 token 預測。結果是一個模型,可以從三秒聲學提示中克隆未見過的說話者,達到最先進的自然度和說話者相似性。

更深層的故事是 in-context learning 在音頻域中的出現。VALL-E 保留了說話者的情感,甚至還有提示的聲學環境,這是舊的拼接型和神經 TTS 系統無法在此品質水平上匹配的行為。對於任何推出語音克隆、配音或個性化助理的人來說,這就是改寫遊戲規則的論文,它開啟了隨後 codec-LM TTS 的浪潮。如果你有三分鐘時間,想要核心直覺而不想讀完整篇論文,按播放鍵就行。