超越数据扩展:面向视觉语言动作模型的表征中心持续预训练
该研究提出了 VLAct,一种面向视觉语言动作(VLA)系统的视觉语言模型骨干。VLAct 使用来自多种机器人形态的异构机器人数据进行持续预训练,在保留视觉语言模型通用知识的同时,促进跨机器人形态的共享动作语义。在固定机器人数据量和微调预算下,VLAct 在仿真、真实环境任务以及向未见机器人形态迁移时均提升了性能。它在 LIBERO-Plus 和 RoboTwin 2.0 上分别取得 82.6% 和 92.5% 的成功率,超过多个工业级 VLA 系统。在未见过的人形机器人形态 RoboCasa-GR1 上,仅使用 20% 的下游轨迹数据,VLAct 就超过了使用完整数据训练的 GR00T-N1.6 基线。实验使用完全开放的数据,并仅采用 16 张 GPU 进行训练,表明提升表征质量可以成为机器人数据扩展之外的另一条 VLA 改进路径。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。