模态自回归世界动作模型
研究人员推出 ModAR,这是一种在预测机器人动作之前,自回归生成多种未来模态的世界动作模型,包括点轨迹、DINO 特征和深度图。每次预测都可以基于此前生成的模态,因此相比仅预测未来 RGB 图像,能够更高效地捕捉几何、语义和运动信息。在所有测试数据规模下,ModAR 都优于现有世界动作模型方案,观测到的平均成功率达到 75%,高于以视频模型初始化的 Flex-π 的 72%。同时,ModAR 无需预训练,训练 FLOPs 约减少 20 倍。在三项真实世界双手操作任务中,ModAR 也超过了基线模型,并且在加入人类视频后性能进一步提升。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。