原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.08021
立即前往原文

Evidence-RL:迈向以证据为核心的视觉推理

该研究提出反事实证据解耦(Counterfactual Evidence Disentanglement,CED),用于检验视觉语言模型是否真正依据图像中的相关局部证据作答。CED会屏蔽物体中心的证据区域,并将答案支持度的下降幅度与对应非证据区域进行比较。研究人员将这一信号与GRPO中的答案正确性结合起来,奖励依赖证据路径的正确回答,而不是依赖语言先验、捷径或无关视觉信息的回答。CED不需要针对每个问题提供证据标注,也不会增加推理时的额外开销。在9个公开基准和4个模型骨干上,CED的表现优于此前基于强化学习的后训练方法;针对性分析也验证了其面向物体的信号。
行业资讯 AI模型 研究 2026-08-11 10:00:58 729 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。