原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.32712
立即前往原文

MassAlloc Attention:让注意力机制自行分配计算量

研究人员推出 MALA,这是一种融合式注意力算子,可根据归一化后的注意力贡献分配分数计算之后的计算量。在 128K token 基准测试中,与 FullAttn 相比,MALA 将训练前向和反向计算的延迟分别降低至原来的 1/2.2 和 1/3.0,推理解码延迟则降低至 1/1.6。在 0.6B 至 14B 参数模型的测试中,其困惑度与 FullAttn 接近,在知识、推理和长上下文检索评测中的表现也相当。这些结果表明其在已测试条件下有所改进,并不代表普遍优越。
行业资讯 研究 2026-09-29 11:01:13 589 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。