后训练中的“锐化税”
一项研究考察了这样一种假设:大型语言模型的强化学习后训练,主要是强化基础模型已有的行为。这可能提高单次尝试的准确率,却降低多次尝试时的解法覆盖率。在智能体任务中,配备轻量推理框架的预训练模型虽然 pass@1 较低,但在拥有足够测试时计算预算时,可能在 pass@K 上超过后训练模型。研究人员提出“锐化税”指标,用于衡量后训练造成的测试时扩展性损失。在分析的 42 个模型与基准测试案例中,大多数都出现了这一现象。他们还提出 PTGS 贝叶斯采样方法,根据提示难度调整采样温度;在两个强化学习环境中,该方法减少了损失,同时提高了单次尝试的准确率。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。