重新思考潜在视觉推理:让潜在推理建立在视觉证据之上
潜在视觉推理使多模态大型语言模型能够通过连续的潜在 token 执行中间计算,而不必将每一步推理都表达为文字。由于这些步骤无法直接观察,监督其学习较为困难。研究发现潜在 token 与视觉证据之间存在差距:即使图像变化会影响正确答案,token 的反应仍然较弱。研究人员认为,GRPO 训练缺乏明确监督可能是原因之一,并提出 ReaLVR,通过对比正确与错误答案、相关与不匹配的视觉证据来引导潜在处理。在三个模型系列中,ReaLVR 均优于受测的 LVR 基线方法;Qwen2.5-VL-7B 在五项任务上的平均成绩为 63.7%。研究还报告称,该方法在参数规模最高达 2350 亿的模型上仍能带来提升。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。