原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.07043
立即前往原文

TRIAGE:以方向感知方式稳定原生 NVFP4 强化学习

论文研究学习器与采样器执行不一致如何导致大语言模型强化学习不稳定。研究发现,不一致的方向与幅度同样重要。TRIAGE 在响应片段级别诊断有问题的更新贡献,选择性地重新平衡策略梯度更新,并对残留的严重不一致进行有界修正。该方法在学习器和采样器两端均保留原生 NVFP4 执行,使用 4 位权重和激活值。在 Qwen3-4B 和 Qwen3-30B-A3B 上的实验显示,在评估的训练周期内优化过程保持稳定,五项数学推理基准达到 BF16 水平;rollout 吞吐量最高可达 BF16 的 2.3 倍。
行业资讯 AI模型 研究 2026-10-08 10:30:57 321 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。