从预训练到熟练:以最少人工干预实现长时程操作的真实环境子任务强化学习
研究人员提出 PARTS,通过强化学习专门改进机器人基础策略容易失败的关键子任务。系统无需重新收集完整任务示范,而是在保留预训练策略常规动作的同时,重点训练任务瓶颈。学习得到的选择器和成功验证器会触发残差修正并提供局部奖励,因此即使完整任务成功样本稀少,也能继续学习。在双臂 YAM 任务中,完整任务成功率从32%提升至61%;在单臂 Franka 任务中,则从50%提升至95%。每项任务平均只需数十分钟的真实机器人强化学习运行,并且比现有方法需要更少的人工参与。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。