原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.21788
立即前往原文

从预训练到熟练:以最少人工干预实现长时程操作的真实环境子任务强化学习

研究人员提出 PARTS,通过强化学习专门改进机器人基础策略容易失败的关键子任务。系统无需重新收集完整任务示范,而是在保留预训练策略常规动作的同时,重点训练任务瓶颈。学习得到的选择器和成功验证器会触发残差修正并提供局部奖励,因此即使完整任务成功样本稀少,也能继续学习。在双臂 YAM 任务中,完整任务成功率从32%提升至61%;在单臂 Franka 任务中,则从50%提升至95%。每项任务平均只需数十分钟的真实机器人强化学习运行,并且比现有方法需要更少的人工参与。
行业资讯 应用 研究 2026-09-22 02:01:04 492 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。