MassAlloc Attention:让注意力机制自行分配计算量
研究人员推出 MALA,这是一种融合式注意力算子,可根据归一化后的注意力贡献分配分数计算之后的计算量。在 128K token 基准测试中,与 FullAttn 相比,MALA 将训练前向和反向计算的延迟分别降低至原来的 1/2.2 和 1/3.0,推理解码延迟则降低至 1/1.6。在 0.6B 至 14B 参数模型的测试中,其困惑度与 FullAttn 接近,在知识、推理和长上下文检索评测中的表现也相当。这些结果表明其在已测试条件下有所改进,并不代表普遍优越。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。