Deepmind's WaveNetのレビュー: TTS/音声合成 (GPTのように見えませんか?)
Tacotronより前に、VALL-Eより前に、ニューラルコデックがオーディオをトークンに変える前に、DeepMindのWaveNetは、ニューラルネットワークがサンプルごとに生のオーディオウェーブフォームを生成し、すべてのパラメトリックなanを上回ることができることを示した論文でした
Tacotronより前に、VALL-Eより前に、ニューラルコデックがオーディオをトークンに変える前に、DeepMindのWaveNetは、ニューラルネットワークがサンプルごとに生のオーディオウェーブフォームを生成し、自然さの点であらゆるパラメトリックおよび連結TTSシステムを上回ることができることを示した論文でした。今、GPT風の眼鏡をかけてそれを見てください。そして、その類似性は不気味です:完全に確率的な自己回帰モデルで、各サンプルをすべての前のサンプルを条件とした—LLMsが家庭用語になる5年前のオーディオのための言語モデル。
このレビューでは、16 kHzで機能させたアーキテクチャをウォークスルーします:受容野を指数関数的に成長させるための拡張因果畳み込み、ゲート付き活性化、残差およびスキップ接続。また、WaveNetがTTS以外で実証したもの—音声を交換するためのスピーカーコンディショニング、副産物としての音楽生成、判別モデルとしても機能する競争力のある音素認識についても説明します。最新の音声生成AIが実際にどこで始まったのか、そしてなぜオートレグレッシブトークンオーバーオーディオのパラダイムが新しいTTSシステムで何度も戻ってくるのかを知りたい場合は、この回顧的レビューは優れた基礎を提供します。
