原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.13141
立即前往原文

SAS:通过端到端优化上下文排序实现简单注意力稀疏化

SAS 是一种面向预训练 Transformer 的稀疏注意力方法,通过语言模型损失直接优化上下文选择。与仅根据密集注意力权重对 token 或区块进行排序的方法不同,SAS 在训练期间将选择器的连续分数注入注意力 logits,使其能够通过标准反向传播进行更新。该方法在注意力 softmax 内使用对数形式的门控,并通过归一化门控平衡历史上下文与始终保留的当前区块。研究团队还实现了节省内存的 Triton 内核,以支持长序列训练。研究显示,SAS 在推理、长上下文理解和智能体任务上优于可训练的稀疏注意力基线,且在注意力预算较紧时提升尤其明显。
行业资讯 AI模型 研究 2026-09-14 10:31:02 254 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。