原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.26070
立即前往原文

Prefix Sliding 提升测试时扩展效率

Prefix Sliding 研究提出了一种降低语言模型长时间推理内存成本的方法。模型不再通过完整注意力机制保留全部推理轨迹,而是仅保留包含关键指令和工具信息的前缀,以及最近几千个词元组成的窗口。这样,无论推理持续多久,内存需求都能保持在固定上限内。研究人员称,在无需额外训练的情况下,该方法可让现有模型提速最多三倍,同时保持性能。结合强化学习后,模型还能处理超过十万个词元的推理轨迹,并取得更好表现。相关代码已在 GitHub 上开源。
行业资讯 AI模型 研究 开源 2026-08-28 01:00:52 694 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。