原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.10706
立即前往原文

HuRo:将人类视频机器人化,用于可扩展的VLA预训练

HuRo研究将人类活动视频机器人化后,能否作为视觉—语言—动作(VLA)模型预训练的可扩展监督数据。研究团队开发了一套流程,将不同来源的人类视频转换为与机器人对齐的观测数据和动作轨迹,并推断缺失的中间信号。由此构建的数据集包含约63万条机器人化片段,以及来自五个人类视频来源的1.42亿个处理帧。在四项真实世界操作任务中,增加机器人化预训练数据后,整体完成率从51.5%提升至80.3%;在空间和视觉条件发生变化时,完成率则从34.9%提升至72.2%。消融实验表明,视觉机器人化可以增强分布外鲁棒性,而使用重新映射动作进行端到端预训练的效果优于仅进行视觉迁移。
行业资讯 应用 AI模型 研究 2026-09-22 11:31:08 448 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。