SparseDecoding:面向解码的剪枝方法提升大语言模型推理效率与准确性
SparseDecoding 是一种无需训练的剪枝框架,旨在降低大语言模型解码阶段的延迟。与使用预先收集的自然文本序列进行校准的传统方法不同,该方法在密集模型自回归生成过程中收集各层激活值,并排除预填充阶段,从而使剪枝目标更贴合实际解码时的激活分布。系统还实现了经过优化的 N:M 稀疏矩阵向量内核,采用位掩码索引和固定步长遍历,重点优化解码中占主导地位的矩阵向量运算。在 Llama-3.1-8B、Llama-3.3-70B 和 Qwen3-14B/32B 上的实验表明,该方法在长文本生成中优于标准固定文本校准,并在 A100 GPU 上实现最高 1.48 倍的端到端解码加速。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。