RefineGAN: Universally Generating Waveform Better than Ground Truth with Highly Accurate Pitch and

Tutorials

RefineGAN:通用波形生成優於基準真值,具有高精度音高和

「優於基準真值」是那種讓人要麼翻白眼要麼點擊播放的說法。

「優於基準真值」是那種讓人要麼翻白眼要麼點擊播放的說法。RefineGAN用一個神經聲碼器來支持這一說法,該聲碼器重建的波形具有如此精確的音高和強度再現,以至於聽眾有時更傾向於合成輸出而非原始錄音——在GAN聲碼器領域尚屬首創。秘訣在於一個音高引導的精化架構,它從粗糙的模板信號開始,在多尺度譜和對抗損失下迭代銳化。

除了令人印象深刻的MOS分數外,RefineGAN可以跨歌手、說話人,甚至未見過的語言進行泛化,而無需重新訓練,這對於大規模部署TTS或語音轉換很重要。演講將介紹基於模板的生成器、為什麼音高調理是解鎖保真度增益的關鍵,以及該模型與HiFi-GAN及其衍生物的位置。如果你正在構建任何將梅爾頻譜圖轉換回音頻的應用——TTS、唱歌合成、語音克隆——這裡的設計理念值得借鑒。