EXIMO:视觉语言模型引导的VLA策略探索
EXIMO是一种用于高效微调视觉—语言—动作模型(VLA)的方法,面向机器人操作任务。该方法分为三个阶段:视觉语言模型负责规划并拆解复杂的长期任务;系统利用这些规划结果收集组织化数据,并通过模仿学习微调VLA策略;最后使用残差离策略强化学习进一步优化。EXIMO旨在减少对昂贵远程操作数据的依赖,并缓解强化学习在长期任务中的样本效率问题。作者在实验中报告称,该方法在样本效率和最终性能方面均显著优于现有方法。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。