重新审视大语言模型强化学习中的训练—推理不匹配问题
该研究分析了大语言模型在可验证奖励强化学习中,推理引擎与训练引擎之间的不匹配。由于两个引擎可能为相同的 token 分配不同概率,研究人员提出校准重要性采样(CIS),根据 token 的置信度限制重要性比率。理论上,CIS 将精确重要性采样中无界的二阶矩替换为有界项,同时控制由此产生的偏差。在三个混合专家模型和五个数学推理基准上的评估中,CIS 在三个模型上均取得了所有比较基线中的最高平均成绩。诊断分析还表明,与截断重要性采样相比,CIS 对低置信度 token 产生的截断偏差更小。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。