Enfold将世界模型的想象融入预测表征,实现超高效具身控制
Enfold将生成式世界模型构建未来时所使用的计算,迁移到一种仅根据当前视觉上下文和语言指令预测的表征中。在训练期间,生成器处理观测到的未来时产生的多层中间状态,用于监督仅依赖当前信息的编码器。部署后,系统无需为每个动作运行生成器。在LIBERO、RoboTwin2.0和真实机器人任务上的评估显示,Enfold在保持较强控制性能的同时,相比Fast-WAM将动作延迟降低了3.7倍;Enfold-Flash达到10.1倍的降低幅度。表征分析表明,该方法能够抑制无关变化,并重点捕捉更长时间范围内才会出现的变化。当人类改变当前场景时,系统生成的后续状态和执行动作也会相应调整,说明它并非简单回放固定轨迹。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。