RetireOPD:面向智能体强化学习的自适应退出式在线策略蒸馏
RetireOPD是一种面向智能体强化学习的训练方法。它首先利用环境奖励优化一个具备特定技能的教师模型,再通过在线策略蒸馏,将这些能力传递给没有预设技能的学生模型。当学生与教师之间的性能差距不再缩小,且学生达到教师成功率的目标比例后,学生会自行停止依赖教师,随后仅通过强化学习继续训练。在参数规模为15亿至70亿的Qwen2.5模型上,RetireOPD相比仅使用强化学习的基线,将ALFWorld成功率提升了14.1%至18.8%,并将WebShop准确率提升了11.8%至19.0%。在所有测试设置中,学生模型的表现也超过了教师模型。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。