原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.01509
立即前往原文

后训练中的“锐化税”

一项研究考察了这样一种假设:大型语言模型的强化学习后训练,主要是强化基础模型已有的行为。这可能提高单次尝试的准确率,却降低多次尝试时的解法覆盖率。在智能体任务中,配备轻量推理框架的预训练模型虽然 pass@1 较低,但在拥有足够测试时计算预算时,可能在 pass@K 上超过后训练模型。研究人员提出“锐化税”指标,用于衡量后训练造成的测试时扩展性损失。在分析的 42 个模型与基准测试案例中,大多数都出现了这一现象。他们还提出 PTGS 贝叶斯采样方法,根据提示难度调整采样温度;在两个强化学习环境中,该方法减少了损失,同时提高了单次尝试的准确率。
行业资讯 AI模型 研究 2026-10-02 14:00:56 631 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。