HuRo:将人类视频机器人化,用于可扩展的VLA预训练
HuRo研究将人类活动视频机器人化后,能否作为视觉—语言—动作(VLA)模型预训练的可扩展监督数据。研究团队开发了一套流程,将不同来源的人类视频转换为与机器人对齐的观测数据和动作轨迹,并推断缺失的中间信号。由此构建的数据集包含约63万条机器人化片段,以及来自五个人类视频来源的1.42亿个处理帧。在四项真实世界操作任务中,增加机器人化预训练数据后,整体完成率从51.5%提升至80.3%;在空间和视觉条件发生变化时,完成率则从34.9%提升至72.2%。消融实验表明,视觉机器人化可以增强分布外鲁棒性,而使用重新映射动作进行端到端预训练的效果优于仅进行视觉迁移。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。