用于输出头量化的 Softmax 重参数化
研究人员提出一种训练后方法,用于降低小型语言模型输出头的量化误差。量化前,该方法从每个输出行中减去词表行均值的一个标量倍数,以选择功能等价的输出头,并通过验证集确定系数。在七个输出头上测试时,Phi-4-mini 在 W4 和激活加权 MSE 设置下的 KL 散度从 0.936 降至 0.256。该方法可与 GPTQ、按通道缩放和仿射量化互补。采用 W4 量化 Phi 输出头后,批大小为 1 的生成延迟相比 BF16 输出头基线降低了 10.8%,且无需增加推理操作。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。