原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.06801
立即前往原文

MC-Sparse:分析并缩小扩散 Transformer 中密集与稀疏注意力的差距

稀疏注意力可降低扩散 Transformer 处理长序列时的延迟,但稀疏度过高往往会损害生成质量。研究指出,质量下降源于 token 分组限制、交互选择不准确,以及丢弃 token 时损失的注意力贡献。研究提出无需训练的 MC-Sparse:选择单个键值(KV)token,将相似查询分组以便在 GPU 上高效执行,并在后续去噪步骤中复用缓存的元数据。在视频和 3D 生成测试中,与密集注意力相比,MC-Sparse 在 Minimax-H3-Base 上实现 1.80 倍去噪加速,在 3D 资产生成上实现 2.32 倍加速,质量损失可以忽略。
行业资讯 应用 研究 2026-10-09 17:30:58 154 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。