原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.13760
立即前往原文

被放大不等于更具预测力:思考模型中的推理行为

一项研究考察了人工智能模型推理轨迹中哪些行为与正确答案相关,以及面向推理的训练是否会放大这些行为。研究人员分析了15个模型在6个文本和视觉语言基准测试中的15,282条标注轨迹,发现了“放大—提升差距”:思考模型显著增强了自我纠错、假设检验和承认不确定性,但这些行为并不是正确性的最佳指标。置信度校准、知识一致性和自我意识与正确答案的关联更强,却几乎没有被放大。研究结果表明,训练目标应奖励经过校准且有依据的推理过程,而不是仅仅奖励表面上更像深思熟虑的表达。
行业资讯 AI模型 研究 2026-08-17 23:31:34 433 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。