原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.02737
立即前往原文

语言模型可以控制自己的注意力

语言模型通常只需关注长上下文中的一小部分内容,但此前仍必须扫描整个 KV 缓存来寻找相关 token。Declarative Attention(DA)让模型在生成过程中自行声明需要关注完整上下文、特定区域,还是仅关注最近的输出。推理引擎会像处理工具调用一样解析这些声明,从而跳过大部分 KV 缓存读取。在涵盖 15 项长上下文任务的零样本评测中,DA 使 Gemma-4-31B 和 Qwen-3.6-27B 的注意 token 数分别减少 52.0% 和 31.1%。准确率下降幅度较小,分别为 1.27 和 2.75 个百分点,并且随着模型规模增大而缩小。
行业资讯 AI模型 研究 2026-09-03 11:30:58 198 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。