原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.10114
立即前往原文

长上下文混合模型机制,第1.1部分:从混合注意力到混合位置编码

该研究分析了将全注意力与滑动窗口注意力,或门控线性注意力变体相结合的大语言模型。作者发现,扩展上下文时存在跷跷板效应:线性注意力混合模型从长上下文持续预训练中获益更多,而滑动窗口混合模型在向更长序列进行长度外推时表现更好。研究还总结了滑动窗口混合模型的多项局限,并提出 Sliding-Window Linear Attention。作者称,该方法无需额外训练即可实现16倍长度外推,并在64K上下文长度下的NIAH-SK1测试中保持100%的准确率。
行业资讯 AI模型 研究 2026-10-08 11:01:02 286 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。