原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.23189
立即前往原文

EchoWM:开放且可进入的全模态世界模型

EchoWM 是面向交互式生成媒体的全模态世界模型。它能够响应连续导航,同时生成 720p 视频、环境音、音乐和语音。在第一人称场景中,镜头意图用于指定观察者的运动;在第三人称场景中,镜头与角色之间的动态关系则从数据中学习。离散指令和连续姿态会映射到统一的米制相对六自由度轨迹。研究团队通过专用数据引擎和渐进式训练,支持长时段生成,并保持环境音与语音同步。公开世界模型基准测试显示,该模型具备较强的轨迹跟随能力和良好的视觉质量,同时支持多种主体的第一人称和第三人称交互。
行业资讯 应用 AI模型 研究 2026-08-25 15:31:03 992 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。