AI 新闻中心

AI 新闻中心 过去24小时分析了 191 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Rationale-Guided Policy Optimization:借助自适应推理支架学习推理

研究人员提出 Rationale-Guided Policy Optimization(RGPO),这是一种旨在解决语言模型推理训练中奖励信号稀疏问题的 on-policy 强化学习框架。该方法根据模型当前能力,将标准推理过程作为临时支架;随后,只把获得更高奖励的模型生成答案转入无引导训练。研究人员称,RGPO 在纯文本和视觉语言推理任务上的表现均优于 RLVR 基线。消融研究表明,自适应推理引导