FlashPrefill V2:面向长上下文大模型服务的块稀疏预填充注意力
FlashPrefill V2 改进了面向长上下文大语言模型预填充阶段的块稀疏注意力方法。新增的均值校正项可在极高稀疏度下抑制近似误差,同时通过 PackGQA 内存访问、warp 专门化、流水线处理和 FP8 推理支持提升实际执行效率。该系统还支持分页 KV 缓存和连续批处理,可作为注意力后端集成到 SGLang 等推理框架中。在 NVIDIA H20 GPU 上进行 128K 上下文测试时,作者报告其相较 FlashAttention-2 在 FP8 和 BF16 下分别最高加速 47.26 倍和 27.19 倍。在 FP8 下,相较于与 FA3/4 对齐的稠密基线,最高加速达到 30.49 倍。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。