語音生成式 AI:Meta AI 的 VoiceBox(也涉及流匹配和神經 ODE)
多年來,語音生成在規模和通用性上都落後於文本和圖像生成——每個任務都配備了自己的定製模型。
多年來,語音生成在規模和通用性上都落後於文本和圖像生成——每個任務都配備了自己的定製模型。Meta AI 的 Voicebox 打破了這種模式。它是一個非自迴歸流匹配模型,在超過 50,000 小時的未經過濾的語音上訓練,用來把一件事做好:在給定周圍背景和文本的情況下填充音頻。這個單一目標解鎖了零樣本 TTS、跨語言合成、噪聲移除、內容編輯和風格轉移,全部來自同一個檢查點。
此講座深入探討了為什麼流匹配(以及其下的神經 ODE 機制)非常適合語音——連續的、非自迴歸的,並且在可比質量下比擴散快得多。它還將標題數字置於背景中:Voicebox 在可理解性(1.9% vs 5.9% WER)和說話者相似性上都擊敗了 VALL-E,同時運行速度快達 20 倍。如果你在跟蹤 VALL-E 和 Whisper 之後語音基礎模型的方向,或者你想真正理解流匹配在做什麼而不只是閱讀流行詞,這個深度講座值得一聽。
