GenFirst:先生成后重建,实现稳定的端到端潜在生成建模
潜在生成模型通常采用两阶段训练:先用变分自编码器学习重建,再在冻结的潜在空间中训练生成模型。研究人员指出,为重建优化的潜在表示不一定适合生成。分析表明,KL 散度目标中的熵项对于防止潜在空间坍塌至关重要,同时重建的学习速度更快、监督更强。GenFirst 因此先通过生成目标塑造潜在空间,再逐步加强重建,以恢复视觉细节。在 ImageNet-256 上,SiT 使用 CFG 时取得 0.97 的 gFID,不使用时为 1.45;MMDiT 在文本生成图像任务中达到 0.90 的 GenEval 分数。该框架还扩展到共享视觉潜在表示以及统一的文本图像生成。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。