原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.37372
立即前往原文

先思考,再评分:面向视觉生成的思考型奖励模型

视觉奖励模型用于评估和改进图像生成模型。现有方法通常将任务条件和生成结果直接映射为单一奖励分数,却没有明确说明每个案例应评估哪些要素。研究团队提出“Think Before You Score”,先为每个案例制定评估标准,再依据标准判断结果。其思考型奖励模型(TRM)可生成细粒度的逐项评分。团队还提出PD-GRPO优化方法,利用成对比较,同时力求保留细致评分。在图像生成和编辑基准测试中,TRM优于其他开源奖励模型,并与专有模型保持较强竞争力。将TRM用作奖励信号,也提升了多种视觉生成模型的表现。
行业资讯 AI模型 研究 开源 2026-09-30 10:01:21 437 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。