语言模型可以控制自己的注意力
语言模型通常只需关注长上下文中的一小部分内容,但此前仍必须扫描整个 KV 缓存来寻找相关 token。Declarative Attention(DA)让模型在生成过程中自行声明需要关注完整上下文、特定区域,还是仅关注最近的输出。推理引擎会像处理工具调用一样解析这些声明,从而跳过大部分 KV 缓存读取。在涵盖 15 项长上下文任务的零样本评测中,DA 使 Gemma-4-31B 和 Qwen-3.6-27B 的注意 token 数分别减少 52.0% 和 31.1%。准确率下降幅度较小,分别为 1.27 和 2.75 个百分点,并且随着模型规模增大而缩小。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。