原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.31291
立即前往原文

用于输出头量化的 Softmax 重参数化

研究人员提出一种训练后方法,用于降低小型语言模型输出头的量化误差。量化前,该方法从每个输出行中减去词表行均值的一个标量倍数,以选择功能等价的输出头,并通过验证集确定系数。在七个输出头上测试时,Phi-4-mini 在 W4 和激活加权 MSE 设置下的 KL 散度从 0.936 降至 0.256。该方法可与 GPTQ、按通道缩放和仿射量化互补。采用 W4 量化 Phi 输出头后,批大小为 1 的生成延迟相比 BF16 输出头基线降低了 10.8%,且无需增加推理操作。
行业资讯 硬件 AI模型 研究 2026-09-28 22:31:47 815 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。