EchoWM:开放且可进入的全模态世界模型
EchoWM 是面向交互式生成媒体的全模态世界模型。它能够响应连续导航,同时生成 720p 视频、环境音、音乐和语音。在第一人称场景中,镜头意图用于指定观察者的运动;在第三人称场景中,镜头与角色之间的动态关系则从数据中学习。离散指令和连续姿态会映射到统一的米制相对六自由度轨迹。研究团队通过专用数据引擎和渐进式训练,支持长时段生成,并保持环境音与语音同步。公开世界模型基准测试显示,该模型具备较强的轨迹跟随能力和良好的视觉质量,同时支持多种主体的第一人称和第三人称交互。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。