Transformer 可以同时容纳两种想法:LLM 中线性叠加的证据
这项研究报告称,将不同文本流的输入进行线性组合时,Transformer 可能会产生各自下一 token 预测的叠加结果。研究者将这一观点称为“叠加线性假说”,并认为这可能是架构本身的属性,而不只是训练的结果。研究观察到,这种线性特征在预训练过程中往往会减弱,但通过轻量微调可以部分恢复。研究还提出一种引导式解码方法,旨在通过一次前向传播生成两段连贯的后续文本。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。