V-Rubrics:通过基于评分标准的强化学习提升视觉忠实度
V-Rubrics针对视觉语言模型后训练中的信用分配问题提出了一种方法:模型生成的回答可能语言流畅,却包含缺乏视觉证据支持的说法或错误的推理步骤。该方法将参考回答拆分为原子命题,并从视觉忠实度、推理一致性和指令遵循三个方面评估生成回答。研究团队从17个具有视觉依据的数据源构建了V-Rubrics 50K数据集,共包含50,248个样本,并以Qwen3-VL-8B-Instruct为基础模型,使用按组件划分且局部定位的评分标准奖励进行训练。实验表明,该方法优于监督微调基线和仅评估完整回答的GRPO,在知识导向和视觉推理基准上的提升最为明显。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。