原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.29845
立即前往原文

Transformer 可以同时容纳两种想法:LLM 中线性叠加的证据

这项研究报告称,将不同文本流的输入进行线性组合时,Transformer 可能会产生各自下一 token 预测的叠加结果。研究者将这一观点称为“叠加线性假说”,并认为这可能是架构本身的属性,而不只是训练的结果。研究观察到,这种线性特征在预训练过程中往往会减弱,但通过轻量微调可以部分恢复。研究还提出一种引导式解码方法,旨在通过一次前向传播生成两段连贯的后续文本。
行业资讯 AI模型 研究 2026-09-25 21:31:06 352 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。