打破视觉—动作捷径:面向可泛化机器人基础模型的潜在接口训练
机器人基础模型在训练分布内通常表现良好,但遇到视觉分布变化时性能容易下降。研究提出潜在接口训练(LIT),旨在减少模型对“视觉—动作捷径”的依赖,即利用与任务无关、却在训练数据中与动作相关的视觉线索。第一阶段不使用图像,让动作专家根据语言、机器人状态以及示范动作片段的末端执行器终点位姿,学习生成面向目标的动作序列。第二阶段引入经过位姿监督的潜在接口,融合视觉和语义表示,并作为动作专家唯一的视觉条件输入通道。在四种视觉语言动作和世界动作架构上,LIT使LIBERO-Plus成功率提升3.87至10.70个百分点,同时保持或提高LIBERO平均性能。在真实环境中,面对未见过的相机配置、光照变化和干扰物,三个任务的总体成功率提升13.30至16.70个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。