原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.12419
立即前往原文

MInTRL:离策略干预可提升在策略强化学习

该研究提出最小干预强化学习(MInTRL),用于扩展采用可验证奖励的强化学习系统的探索范围。在生成过程中,评判策略会检查当前策略的输出,用简短修正替换错误的后缀,然后将控制权交还给原策略。序列级优势回归目标避免了重要性采样的需要。在数学和代码基准测试中,MInTRL 的表现优于标准的在策略和离策略基线方法。结果表明,稀疏、局部的干预能够提升探索覆盖范围,同时保持训练轨迹总体上的在策略特征。
行业资讯 AI模型 研究 2026-09-15 16:01:17 224 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。