思维链表象之下:大语言模型推理操作的机制解释
一项研究考察了大语言模型如何在内部表示空间中组织问题构建、目标分解和演绎等推理操作。研究人员发现,这些操作可以在留作测试的隐藏表示中被区分,且在模型中间层的可分离性最高。该结构不能仅由词汇或位置因素解释。随着层数增加,推理操作的对应关系会分布到更长的词元片段中;同一个表面词也会因周围推理操作不同而产生不同的内部表示。注意力屏蔽干预进一步表明,推理片段开头与操作相关的表示依赖此前的推理上下文。研究团队已公开代码和项目材料。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。