原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.31075
立即前往原文

让大型推理模型突破人类监督持续扩展

本文研究在人类监督逐步退出学习闭环后,大型推理模型(LRM)如何继续提升。对于数学和编程等结果可自动验证的任务,利用可验证奖励的强化学习已经显著改善了推理能力;但在开放式任务和智能体任务中,可靠奖励更难获得。研究分析了两个相互关联的方向:从逐个实例的人类判断转向可复用的验证器和无需人工反馈的奖励,以及从人工策划的任务和环境转向模型自行生成的课程、构建的环境和自主协同进化。L0至L4的五级框架用于标识学习过程中的哪些部分仍由人类控制。论文还讨论了自主奖励和经验生成带来的风险,包括奖励投机、反馈漂移、课程崩溃和环境错误。作者建议从模型能力、反馈保真度和经验质量三个方面进行评估,并维护一个持续更新的 GitHub 仓库来跟踪相关进展。
行业资讯 伦理与安全 AI模型 研究 开源 2026-09-01 11:30:48 973 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。