原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.19758
立即前往原文

FlashPrefill V2:面向长上下文大模型服务的块稀疏预填充注意力

FlashPrefill V2 改进了面向长上下文大语言模型预填充阶段的块稀疏注意力方法。新增的均值校正项可在极高稀疏度下抑制近似误差,同时通过 PackGQA 内存访问、warp 专门化、流水线处理和 FP8 推理支持提升实际执行效率。该系统还支持分页 KV 缓存和连续批处理,可作为注意力后端集成到 SGLang 等推理框架中。在 NVIDIA H20 GPU 上进行 128K 上下文测试时,作者报告其相较 FlashAttention-2 在 FP8 和 BF16 下分别最高加速 47.26 倍和 27.19 倍。在 FP8 下,相较于与 FA3/4 对齐的稠密基线,最高加速达到 30.49 倍。
行业资讯 应用 硬件 研究 2026-08-21 13:30:56 435 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。