原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2607.26657
立即前往原文

Enfold将世界模型的想象融入预测表征,实现超高效具身控制

Enfold将生成式世界模型构建未来时所使用的计算,迁移到一种仅根据当前视觉上下文和语言指令预测的表征中。在训练期间,生成器处理观测到的未来时产生的多层中间状态,用于监督仅依赖当前信息的编码器。部署后,系统无需为每个动作运行生成器。在LIBERO、RoboTwin2.0和真实机器人任务上的评估显示,Enfold在保持较强控制性能的同时,相比Fast-WAM将动作延迟降低了3.7倍;Enfold-Flash达到10.1倍的降低幅度。表征分析表明,该方法能够抑制无关变化,并重点捕捉更长时间范围内才会出现的变化。当人类改变当前场景时,系统生成的后续状态和执行动作也会相应调整,说明它并非简单回放固定轨迹。
行业资讯 应用 AI模型 研究 2026-08-11 07:32:06 288 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。