MInTRL:离策略干预可提升在策略强化学习
该研究提出最小干预强化学习(MInTRL),用于扩展采用可验证奖励的强化学习系统的探索范围。在生成过程中,评判策略会检查当前策略的输出,用简短修正替换错误的后缀,然后将控制权交还给原策略。序列级优势回归目标避免了重要性采样的需要。在数学和代码基准测试中,MInTRL 的表现优于标准的在策略和离策略基线方法。结果表明,稀疏、局部的干预能够提升探索覆盖范围,同时保持训练轨迹总体上的在策略特征。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。