原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.12327
立即前往原文

SparseDecoding:面向解码的剪枝方法提升大语言模型推理效率与准确性

SparseDecoding 是一种无需训练的剪枝框架,旨在降低大语言模型解码阶段的延迟。与使用预先收集的自然文本序列进行校准的传统方法不同,该方法在密集模型自回归生成过程中收集各层激活值,并排除预填充阶段,从而使剪枝目标更贴合实际解码时的激活分布。系统还实现了经过优化的 N:M 稀疏矩阵向量内核,采用位掩码索引和固定步长遍历,重点优化解码中占主导地位的矩阵向量运算。在 Llama-3.1-8B、Llama-3.3-70B 和 Qwen3-14B/32B 上的实验表明,该方法在长文本生成中优于标准固定文本校准,并在 A100 GPU 上实现最高 1.48 倍的端到端解码加速。
行业资讯 AI模型 研究 2026-10-11 09:31:08 575 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。