原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.07342
立即前往原文

Rationale-Guided Policy Optimization:借助自适应推理支架学习推理

研究人员提出 Rationale-Guided Policy Optimization(RGPO),这是一种旨在解决语言模型推理训练中奖励信号稀疏问题的 on-policy 强化学习框架。该方法根据模型当前能力,将标准推理过程作为临时支架;随后,只把获得更高奖励的模型生成答案转入无引导训练。研究人员称,RGPO 在纯文本和视觉语言推理任务上的表现均优于 RLVR 基线。消融研究表明,自适应推理引导是取得性能提升的因素之一。
行业资讯 AI模型 研究 2026-10-08 05:00:59 710 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。