UniEvo-VL:用于多模态模型自我改进的在策略自蒸馏训练方法
UniEvo-VL是一种研究框架,让同一个多模态模型同时扮演教师和学生。模型生成带有额外信息的自我批评,并在测试时计算过程中利用这些反馈提升图像生成能力,因此无需独立且更大的教师模型。该方法沿着模型自身的采样轨迹,最小化学生模型与受批评信息条件控制的教师模型之间的扩散分布差异。基于开源模型Qwen-Image-2512的实验显示,GenEval得分从0.747提升至0.808,GenEval2 Soft-TIFA得分从32.97提升至35.53。不过,改进效果并未在所有任务中保持一致,图像文字渲染的结果尤其存在差异。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。