[Olewave評論] AudioLM:音頻生成的語言建模方法
AudioLM是一篇論文,它說服了許多人音頻生成應該看起來更像語言建模而不是信號處理。
AudioLM是一篇論文,它說服了許多人音頻生成應該看起來更像語言建模而不是信號處理。Google的框架將原始波形映射到離散令牌,然後在其上訓練語言模型,將音頻延續視為下一個令牌預測。聰明之處在於混合令牌化:來自掩蔽音頻語言模型的語義令牌處理長期結構,而來自神經編解碼器的聲學令牌提供高保真合成。它們共同解決了使早期方法受阻的權衡。
在沒有成績單或標籤的原始波形上訓練,AudioLM生成的語音延續在保持語法和語義連貫的同時,保留未見聲音的說話者身份和韻律。它也推廣超越語音,在沒有任何符號音樂表示的情況下生成合理的鋼琴延續。這是VALL-E、MusicLM和一波基於令牌的TTS系統的直接知識祖先,因此理解兩階段令牌化器設計在閱讀之後出現的任何內容時會帶來回報。如果您正在構建或評估基於令牌的生成音頻,此評論是關於重塑該領域的思想的有價值的入門書。
