面向细粒度具身交互的多智能体自我中心世界模型
自我中心世界模型根据智能体的视角预测观测结果,但大多数模型只关注单个智能体。ME-World对多个智能体在共享环境中通过细粒度动作进行交互的情形建模,并同步联合生成各自的第一人称视频流。该模型利用所有智能体的目标视角姿态和共享环境记忆,保持视角、动作以及交互引发的状态变化之间的一致性。在真实和合成数据上的评估显示,与现有方法相比,ME-World提升了共享世界一致性、动作控制、身份保持和视频质量。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。