VC-Attention:用于低比特注意力机制的数值平滑与 Softmax 转换
研究人员提出了一种无需训练的低比特注意力机制框架 VC-Attention,旨在优化用于视频生成的扩散 Transformer 模型。为了解决异常值带来的量化误差以及高精度 softmax 导致的计算速度瓶颈,VC-Attention 结合了数值平滑(V-Smooth)与融合概率转换(ExpCast-FP8)。V-Smooth 通过在线聚类重新排列数值 token 以提升量化效果,而 ExpCast-FP8 直接将对数域分数映射至 FP8 格式,从而省去了 FP32 指数计算步骤。在 NVIDIA Blackwell 和 Hopper 等 GPU 上的测试表明,该方法提升了生成质量,并将数据中心的注意力算子速度提升了高达 1.59 倍,工作站上提升了高达 3.6 倍。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。