京东发布可交互视听世界模型 EchoWM,并将其开源
京东在 JDD 大会上公布了 JoyAI-Echo 系列的新进展。JoyAI-Echo1.5 主打超过 10 分钟的音视频连续生成。京东表示,其 Memory Bank 架构可在长时段生成中保持人物形象、声音和故事线的一致性;使用两张 H200 GPU 时,可在 480P 下平均每秒生成 24 帧。开源的 EchoWM 将视频、环境音、音乐和语音的原生生成与用户控制结合起来,支持第一人称导航、摄像机与主体协同控制,以及多轮连续探索。京东称,在 WBench Navigation 评测中,EchoWM 和快速版本 EchoWM-Flash 分别获得第一和第二名。公司还展示了面向零售、物流、医疗、工业和政务的模型与工具。
本文来源:AIbase,仅供学习参考,版权归原作者所有。