原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.34563
立即前往原文

重新思考潜在视觉推理:让潜在推理建立在视觉证据之上

潜在视觉推理使多模态大型语言模型能够通过连续的潜在 token 执行中间计算,而不必将每一步推理都表达为文字。由于这些步骤无法直接观察,监督其学习较为困难。研究发现潜在 token 与视觉证据之间存在差距:即使图像变化会影响正确答案,token 的反应仍然较弱。研究人员认为,GRPO 训练缺乏明确监督可能是原因之一,并提出 ReaLVR,通过对比正确与错误答案、相关与不匹配的视觉证据来引导潜在处理。在三个模型系列中,ReaLVR 均优于受测的 LVR 基线方法;Qwen2.5-VL-7B 在五项任务上的平均成绩为 63.7%。研究还报告称,该方法在参数规模最高达 2350 亿的模型上仍能带来提升。
行业资讯 AI模型 研究 2026-10-02 02:02:52 936 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。