原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.04753
立即前往原文

思维链表象之下:大语言模型推理操作的机制解释

一项研究考察了大语言模型如何在内部表示空间中组织问题构建、目标分解和演绎等推理操作。研究人员发现,这些操作可以在留作测试的隐藏表示中被区分,且在模型中间层的可分离性最高。该结构不能仅由词汇或位置因素解释。随着层数增加,推理操作的对应关系会分布到更长的词元片段中;同一个表面词也会因周围推理操作不同而产生不同的内部表示。注意力屏蔽干预进一步表明,推理片段开头与操作相关的表示依赖此前的推理上下文。研究团队已公开代码和项目材料。
行业资讯 AI模型 研究 开源 2026-09-07 18:31:10 618 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。