原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.35767
立即前往原文

通过交错式强化学习,让统一模型学会原生反思

UMM-Reflection训练统一多模态模型检查图像、发现错误,并通过多轮迭代自行修正生成结果。不同于监督微调,或只优化图像生成器及模型单一部分的强化学习,该方法评估完整的反思轨迹,并同时更新反思文本和图像修订。在BAGEL上,相比监督微调,GenEval提升了12.05分。在训练中未使用的WISE(+10.97)、OneIG-Bench(+3.48)和T2I-CompBench++(+4.63)上也取得了提升。
行业资讯 AI模型 研究 2026-09-29 14:30:58 161 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。