原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.25580
立即前往原文

V-Rubrics:通过基于评分标准的强化学习提升视觉忠实度

V-Rubrics针对视觉语言模型后训练中的信用分配问题提出了一种方法:模型生成的回答可能语言流畅,却包含缺乏视觉证据支持的说法或错误的推理步骤。该方法将参考回答拆分为原子命题,并从视觉忠实度、推理一致性和指令遵循三个方面评估生成回答。研究团队从17个具有视觉依据的数据源构建了V-Rubrics 50K数据集,共包含50,248个样本,并以Qwen3-VL-8B-Instruct为基础模型,使用按组件划分且局部定位的评分标准奖励进行训练。实验表明,该方法优于监督微调基线和仅评估完整回答的GRPO,在知识导向和视觉推理基准上的提升最为明显。
行业资讯 AI模型 研究 2026-08-27 11:30:57 645 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。