
扫码添加

添加学术顾问微信
免费获取服务方案
本期关键词:变分自编码器(VAE)
前两期分别讲了 GAN 与扩散模型(042期),本期补上生成模型"三巨头"的最后一块拼图——变分自编码器(VAE)。如果说GAN是"造假与打假博弈",VAE的思路则是"先压缩、再生成":把高维数据(如图像)压进一个低维"潜空间",让相似的样本在潜空间里彼此靠近,再从潜变量采样解码出新的样本。
核心机制:
- 编码器把输入 x 映射为潜变量 z 的概率分布(而非一个确定值)
- 让 z 的分布尽量接近标准正态(KL散度约束),保证潜空间"连续、可插值"
- 解码器从 z 采样重建 x,训练目标=重建误差+正则项
为什么重要?
- 奠基之作(Kingma & Welling, 2013)开启"深度潜变量模型"方向,与GAN同获"AI教母"Fei-Fei Li等主流认可,是当代一切生成模型的谱系源头之一
- 应用极广:异常检测、分子生成、推荐系统、语音合成(如早期WaveNet的VAE变体)
- 与扩散模型的关系:扩散模型的"潜空间扩散"(LDM/Stable Diffusion)正是"VAE压缩潜空间+扩散生成"的组合——你用的Stable Diffusion里那个把图像压到潜空间的编码器,本质就是一个VAE!
局限性: 生成图像偏模糊(高斯假设与重建损失所致)→ 这恰是后来GAN/扩散模型要解决的痛点。理解这条"VAE→GAN→扩散"的演进线,就理解了生成式AI的半部历史。
📎 参考论文:Auto-Encoding Variational Bayes (Kingma & Welling, 2013)

扫码添加

添加学术顾问微信
免费获取服务方案
本期关键词:变分自编码器(VAE)
前两期分别讲了 GAN 与扩散模型(042期),本期补上生成模型"三巨头"的最后一块拼图——变分自编码器(VAE)。如果说GAN是"造假与打假博弈",VAE的思路则是"先压缩、再生成":把高维数据(如图像)压进一个低维"潜空间",让相似的样本在潜空间里彼此靠近,再从潜变量采样解码出新的样本。
核心机制:
- 编码器把输入 x 映射为潜变量 z 的概率分布(而非一个确定值)
- 让 z 的分布尽量接近标准正态(KL散度约束),保证潜空间"连续、可插值"
- 解码器从 z 采样重建 x,训练目标=重建误差+正则项
为什么重要?
- 奠基之作(Kingma & Welling, 2013)开启"深度潜变量模型"方向,与GAN同获"AI教母"Fei-Fei Li等主流认可,是当代一切生成模型的谱系源头之一
- 应用极广:异常检测、分子生成、推荐系统、语音合成(如早期WaveNet的VAE变体)
- 与扩散模型的关系:扩散模型的"潜空间扩散"(LDM/Stable Diffusion)正是"VAE压缩潜空间+扩散生成"的组合——你用的Stable Diffusion里那个把图像压到潜空间的编码器,本质就是一个VAE!
局限性: 生成图像偏模糊(高斯假设与重建损失所致)→ 这恰是后来GAN/扩散模型要解决的痛点。理解这条"VAE→GAN→扩散"的演进线,就理解了生成式AI的半部历史。
📎 参考论文:Auto-Encoding Variational Bayes (Kingma & Welling, 2013)