LiFT:通过循环流变换器提升图像生成效率
研究人员推出 Loop Flow Transformers(LiFT),这是一系列反复应用同一 Diffusion Transformer(DiT)核心的生成模型。LiFT 不要求每个循环步骤直接输出最终预测,而是训练每一步回归到通往 flow matching 目标的直线路径上的一个中间点。通过连续深度坐标,模型在推理时可以超出训练深度继续运行,无需重新训练或增加参数。在 256×256 的 ImageNet 实验中,LiFT-L/2 的 FID 比密集型 DiT-XL/2 基线低 3.34,同时参数量减少约 60%,训练 FLOPs 减少 32%,推理 FLOPs 减少 52%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。