原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.30457
立即前往原文

学习结果发生变化的位置:面向多模态几何的可归因信用推理

该研究提出“可归因信用推理”,将视觉语言模型在推理过程中使用的语义单元,与学习时比较不同选择并分配学习信用的位置对应起来。Code-CoT保留图表,并将视觉关系表示为可按行定位的可执行代码,再组织为带类型的事件。CE-GRPO利用结构先验和按类型归一化的熵来确定事件边界,从共享前缀生成完整后续序列,并将结果差异转化为局部优势。在9个几何推理基准测试中,该方法平均准确率达到76.04%,比Qwen3-VL-8B高8.09个百分点,比轨迹级GRPO高3.43个百分点。随着中间推理事件增多,其相对优势进一步扩大。
行业资讯 AI模型 研究 2026-09-02 21:01:21 484 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。