Variational Autoencoder (VAE) and Reparameterization Trick - Revisiting the Classic Generative Model

Tutorials

変分オートエンコーダ (VAE) と再パラメータ化トリック - 古典的生成モデルの再検討

拡散の前に、正規化フローの前に、潜在拡散モデルがあらゆる本格的な生成スタックにVAEエンコーダを静かに組み込む前に、KingmaとWellingの2013年論文がありました。それは変分オートエンコーダを導入していました

拡散の前に、正規化フローの前に、潜在拡散モデルがあらゆる本格的な生成スタックにVAEエンコーダを静かに組み込む前に、KingmaとWellingの2013年論文がありました。それは変分オートエンコーダと再パラメータ化トリックを紹介していました。この再検討は、最初にサンプリング操作を通じた確率勾配降下を可能にした古典に立ち戻り、なぜそのアイデアがStable Diffusionからニューラル音声コーデック(EnCodecやSoundStreamなど)に至るまで、現代の生成AIを支えているのかを示しています。

このウォークスルーは、論文が解決した中核的な問題をカバーしています。連続潜在変数と扱いの不可能な事後分布を持つ有向確率モデルで、大規模なデータセット上で効率的な推論と学習を行う方法です。再パラメータ化トリックは中心的なアイデアです。サンプリングされた潜在を、パラメータと注入されたノイズの決定性関数として表現することで、勾配がきれいに流れることができ、スケーラブルな確率変分推論を実現します。ELBOの明確な導出、あらゆる現代的なエンコーダネットワークにインスピレーションを与えた認識モデルのフレーミング、そしてVAEがなぜ今日の多くの生成システムの潜在空間バックボーンとして依然として現れるのかを理解するのに十分な直感を期待できます。潜在内で何が起こっているかを実際に理解したい場合は、10分の価値があります。