量化感知修复:恢复 4 位压缩大语言模型的实用方法
研究提出了一种名为量化感知修复(QAH)的方法,用于在部署前恢复经过结构化压缩并量化为 4 位的大语言模型性能。与传统的量化感知训练不同,QAH 直接从未压缩的原始模型向 4 位学生模型进行知识蒸馏。在 GPT-OSS 120B 缩减至 60B、再转换为 MXFP4 的流程中,开放权重模型 Hypernova-60B 在 9 项基准测试中的 7 项达到或超过了 bfloat16 源模型,同时将权重内存占用降低约 4 倍,参数量减少一半。与匹配的 QAT 基线相比,QAH 达到相近峰值性能的速度约快 7 倍,并在持续训练中保持稳定。研究还报告了不同分布式训练后端之间存在显著且可复现的质量差距。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。