变分自编码器(VAE)与重参数化技巧 - 重温经典生成模型
扩散模型出现前,标准化流出现前,潜在扩散模型悄悄地将VAE编码器植入每一个严肃的生成堆栈之前——有Kingma和Welling在2013年发表的论文介绍了变分自编码器
扩散模型出现前,标准化流出现前,潜在扩散模型悄悄地将VAE编码器植入每一个严肃的生成堆栈之前——有Kingma和Welling在2013年发表的论文介绍了变分自编码器和重参数化技巧。这次回顾深入这一经典之作,它首次使得通过采样操作进行随机梯度下降成为可能,并阐述这些思想为何仍然推动现代生成AI发展,从Stable Diffusion到EnCodec和SoundStream等神经语音编码器。
本次讲解涵盖了论文解决的核心问题:如何在具有连续潜变量和难以处理的后验分布的有向概率模型中进行高效推理和学习,并在大型数据集上进行规模化处理。重参数化技巧是关键枢纽——将采样的潜变量表示为参数的确定性函数加上注入的噪声,这使得梯度能够清晰地流动并开启可扩展的随机变分推理。你会看到ELBO的清晰推导、启发了每一个现代编码器网络的识别模型框架,以及足够的直觉来理解为何VAE仍然作为潜空间骨干出现在当今众多生成系统中。如果你想真正理解潜变量内部发生了什么,这值得花10分钟。
