[Olewave's Review] AudioLM: a Language Modeling Approach to Audio Generation

Tutorials

[Olewaveのレビュー] AudioLM: オーディオ生成への言語モデリングアプローチ

AudioLMは、オーディオ生成が信号処理よりも言語モデリングのように見えるべきだと多くの人々を確信させた論文です。

AudioLMは、オーディオ生成が信号処理よりも言語モデリングのように見えるべきだと多くの人々を確信させた論文です。Googleのフレームワークは生波形を離散トークンにマップし、その上で言語モデルを訓練し、オーディオ継続を次トークン予測としてキャストします。巧妙な部分はハイブリッドトークン化です。マスク済みオーディオ言語モデルからのセマンティックトークンは長期的な構造を処理し、ニューラルコーデックからの音響トークンは高忠度合成を提供します。一緒に、以前のアプローチが困惑させたトレードオフを解決します。

トランスクリプトやラベルなしで生波形上で訓練されたAudioLMは、未見の音声についてスピーカーのアイデンティティとプロソディを保持しながら構文的かつ意味的に一貫していたspeech継続を生成します。また、シンボリック音楽表現なしでもらしきピアノ継続を生成し、音声を超えて一般化します。これはVALL-E、MusicLM、およびトークンベースTTSシステムの波の直接的な知的祖先です。トークンベースの生成オーディオを構築または評価している場合、このレビューは現地を再形成したアイデアの価値のあるプライマーです。