CoWindow Attention:完整因果覆盖是一种集体属性
CoWA 是一种注意力架构,将因果上下文的访问分配给多个 KV 头,而不是让每个头重复处理。每个头只关注部分远距离 token,但所有头合起来仍能覆盖完整上下文。在 128K token 基准测试中,与 FullAttn 相比,CoWA 将训练前向和反向传播延迟分别降低 7.4 倍和 8.6 倍,并将推理解码延迟降低 3 倍。报告中的扩展实验显示,CoWA 在减少总训练计算量的同时,模型质量与 FullAttn 相近。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。