论高维潜在表示的扩散适性
表示自编码器(Representation Autoencoder)使扩散模型能够在预训练视觉编码器的特征空间中运行。然而,许多现成编码器并未针对忠实重建进行优化,因此会丢弃细微的视觉细节。为重建任务微调编码器可以恢复这些细节,但也会降低表示的有效维度并改变其几何结构。研究发现,在这种情况下,流匹配中的标准速度预测要求模型拟合信号低维流形之外的正交噪声方向,导致优化效率低下。改为预测干净数据x₀,则能让学习聚焦于信号流形;在使用多个重建能力较强的编码器进行的实验中,这一方法持续提升了文本生成图像的效果。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。