SQS:通过稀疏量化子分布实现贝叶斯深度神经网络压缩
SQS是一种统一方法,通过同时进行权重剪枝和低比特量化来压缩大型神经网络。该方法采用贝叶斯变分学习,利用尖峰与平 slab 先验引入稀疏性,并使用高斯混合模型表示量化权重。研究人员针对原本难以处理的目标函数提出了高效近似,在尽量减少精度损失的同时实现压缩。针对ResNet、BERT-base、Llama 3.2和Qwen2.5的实验表明,与多种现有方法相比,SQS能够实现更高的压缩率,同时保持相近的性能损失。该方法面向资源受限设备上的大型模型部署。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。