学习结果发生变化的位置:面向多模态几何的可归因信用推理
该研究提出“可归因信用推理”,将视觉语言模型在推理过程中使用的语义单元,与学习时比较不同选择并分配学习信用的位置对应起来。Code-CoT保留图表,并将视觉关系表示为可按行定位的可执行代码,再组织为带类型的事件。CE-GRPO利用结构先验和按类型归一化的熵来确定事件边界,从共享前缀生成完整后续序列,并将结果差异转化为局部优势。在9个几何推理基准测试中,该方法平均准确率达到76.04%,比Qwen3-VL-8B高8.09个百分点,比轨迹级GRPO高3.43个百分点。随着中间推理事件增多,其相对优势进一步扩大。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。