原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.12641
立即前往原文

打破视觉—动作捷径:面向可泛化机器人基础模型的潜在接口训练

机器人基础模型在训练分布内通常表现良好,但遇到视觉分布变化时性能容易下降。研究提出潜在接口训练(LIT),旨在减少模型对“视觉—动作捷径”的依赖,即利用与任务无关、却在训练数据中与动作相关的视觉线索。第一阶段不使用图像,让动作专家根据语言、机器人状态以及示范动作片段的末端执行器终点位姿,学习生成面向目标的动作序列。第二阶段引入经过位姿监督的潜在接口,融合视觉和语义表示,并作为动作专家唯一的视觉条件输入通道。在四种视觉语言动作和世界动作架构上,LIT使LIBERO-Plus成功率提升3.87至10.70个百分点,同时保持或提高LIBERO平均性能。在真实环境中,面对未见过的相机配置、光照变化和干扰物,三个任务的总体成功率提升13.30至16.70个百分点。
行业资讯 应用 AI模型 研究 2026-09-14 10:31:02 813 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。