原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.24682
立即前往原文

像世界模型一样思考,像 VLA 一样行动:将世界模型表征蒸馏为紧凑型机器人策略

研究人员提出一种方法,在部署时无需进行高成本的未来模拟,就能将世界模型对物理场景的理解迁移到紧凑型视觉-语言-动作(VLA)策略中。训练期间,系统使用冻结的世界模型处理训练帧并缓存其特征,再将特征对齐作为额外训练目标。训练完成后移除教师模型,因此部署策略的运行成本与基线模型相同:在消费级 RTX 5090 上,每次决策耗时 32 毫秒,占用 1.86GB 内存。一个拥有 8 亿参数的学生模型在 LIBERO 上达到 97.9%,并将 RoboCasa-GR1 人形机器人操作任务的成绩从 48.2% 提升至 50.5%。该方法还在单臂和双臂真实机器人平台上得到验证。
行业资讯 应用 AI模型 研究 2026-09-22 12:01:25 297 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。