原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.15810
立即前往原文

VC-Attention:用于低比特注意力机制的数值平滑与 Softmax 转换

研究人员提出了一种无需训练的低比特注意力机制框架 VC-Attention,旨在优化用于视频生成的扩散 Transformer 模型。为了解决异常值带来的量化误差以及高精度 softmax 导致的计算速度瓶颈,VC-Attention 结合了数值平滑(V-Smooth)与融合概率转换(ExpCast-FP8)。V-Smooth 通过在线聚类重新排列数值 token 以提升量化效果,而 ExpCast-FP8 直接将对数域分数映射至 FP8 格式,从而省去了 FP32 指数计算步骤。在 NVIDIA Blackwell 和 Hopper 等 GPU 上的测试表明,该方法提升了生成质量,并将数据中心的注意力算子速度提升了高达 1.59 倍,工作站上提升了高达 3.6 倍。
行业资讯 应用 硬件 AI模型 研究 2026-09-17 11:31:00 217 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。