通过交错式强化学习,让统一模型学会原生反思
UMM-Reflection训练统一多模态模型检查图像、发现错误,并通过多轮迭代自行修正生成结果。不同于监督微调,或只优化图像生成器及模型单一部分的强化学习,该方法评估完整的反思轨迹,并同时更新反思文本和图像修订。在BAGEL上,相比监督微调,GenEval提升了12.05分。在训练中未使用的WISE(+10.97)、OneIG-Bench(+3.48)和T2I-CompBench++(+4.63)上也取得了提升。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。