面向多轮图像编辑的策略内自蒸馏
研究人员提出MT-OPSD,这是一种提升AI图像编辑模型在迭代编辑中鲁棒性的训练框架。现有模型在每次将新指令应用于上一轮生成的不完美图像时,性能往往会迅速下降。研究认为,原因在于训练阶段使用干净的源图像,而推理阶段必须反复以模型自身的输出作为条件输入,导致条件分布不匹配。MT-OPSD使用模型自行生成的中间状态进行训练,并通过以干净图像为条件的教师模型提供编辑监督,因此无需多轮编辑标注数据。研究团队还推出了LME-Bench,包含100个十轮编辑会话。在三种编辑模型上的实验显示,该方法提升了长程编辑的成功率,减少了多轮性能崩溃,同时基本保持单轮编辑质量。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。