迈向全流程 FP8 大语言模型强化学习
一项新研究分析了在大语言模型的完整强化学习流程中使用 FP8 所导致的不稳定问题。研究人员发现,累积的 FP8 量化噪声会扭曲重要性比率,并错误地将负优势 Token 的梯度归零,从而引发训练中途熵异常激增和输出乱码,使异常结果不断累积。为解决这一问题,研究提出“Calibrated Clipping”,通过动态调整 FP8 的裁剪范围,使其与高精度 BF16 分布保持一致。在 GRPO、DAPO、8B 至 32B 规模模型以及多种 FP8 缩放粒度上的实验显示,该方法能够消除熵激增,并将性能恢复到接近 BF16 基线的水平。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。