先思考,再评分:面向视觉生成的思考型奖励模型
视觉奖励模型用于评估和改进图像生成模型。现有方法通常将任务条件和生成结果直接映射为单一奖励分数,却没有明确说明每个案例应评估哪些要素。研究团队提出“Think Before You Score”,先为每个案例制定评估标准,再依据标准判断结果。其思考型奖励模型(TRM)可生成细粒度的逐项评分。团队还提出PD-GRPO优化方法,利用成对比较,同时力求保留细致评分。在图像生成和编辑基准测试中,TRM优于其他开源奖励模型,并与专有模型保持较强竞争力。将TRM用作奖励信号,也提升了多种视觉生成模型的表现。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。