FuseReg:通过层融合正则化缩小重建与生成之间的差距
表征自编码器(RAE)将预训练视觉编码器的特征用作重建和扩散模型的潜在表示。FuseReg不再固定选择编码器层,而是通过随机层子集进行训练,以提高解码器对不同特征融合方式的适应能力。在使用DINOv3-L的ImageNet-256实验中,单个解码器在完整、稀疏和单层融合下的PSNR均高于针对固定融合训练的解码器。仅替换解码器、保持生成器不变,也使无引导gFID降低了27%。同时对解码器和扩散训练进行正则化,则使DiT-Base上的该指标降低了29%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。