原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.32444
立即前往原文

重新审视大语言模型强化学习中的训练—推理不匹配问题

该研究分析了大语言模型在可验证奖励强化学习中,推理引擎与训练引擎之间的不匹配。由于两个引擎可能为相同的 token 分配不同概率,研究人员提出校准重要性采样(CIS),根据 token 的置信度限制重要性比率。理论上,CIS 将精确重要性采样中无界的二阶矩替换为有界项,同时控制由此产生的偏差。在三个混合专家模型和五个数学推理基准上的评估中,CIS 在三个模型上均取得了所有比较基线中的最高平均成绩。诊断分析还表明,与截断重要性采样相比,CIS 对低置信度 token 产生的截断偏差更小。
行业资讯 AI模型 研究 2026-09-29 10:02:27 369 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。