Review of HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis

Tutorials

HiFi-GANのレビュー: 効率的で高忠実度の音声合成のための生成的敵対的ネットワーク

長い間、ニューラルボコーダーはあなたに選択を強制しました:WaveNetのような自己回帰モデルは素晴らしいオーディオを提供しましたが、非常に遅かった一方で、GANベースの波形ジェネレーターは高速でしたが、目立って低品質でした。

長い間、ニューラルボコーダーはあなたに選択を強制しました:WaveNetのような自己回帰モデルは素晴らしいオーディオを提供しましたが、非常に遅かった一方で、GANベースの波形ジェネレーターは高速でしたが、目立って低品質でした。HiFi-GANはそのギャップを埋めました。単一のV100で22.05 kHzのオーディオを167.9倍のリアルタイムで生成し、人間の録音の範囲内の平均意見スコアに到達し、最新のTTSスタックの大部分のデフォルトボコーダーとなりました。

このレビューは、それを機能させた設計上の洞察に焦点を当てています:音声は多くの異なる周期のサイン波の合計であるため、判別器はそれらの周期を明示的に見る必要があります。HiFi-GANのマルチピリオド判別器(マルチスケール判別器と組み合わせた)は忠実度を上げながらジェネレーターを軽量に保つものです。このウォークスルーでは、未見のスピーカーへのメルスペクトログラム逆変換への汎化方法、エンドツーエンドTTS動作、およびCPUでリアルタイムより13.4倍高速に実行される小さいフットプリント変種についても説明します。2024年のTTS製品用にボコーダーを選択していて、HiFi-GANが依然として合理的なデフォルトである理由を理解したい場合は、このボコーダーの回顧的レビューはあなたの注意に値します。