原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.23383
立即前往原文

JoyAI-Echo-1.5 面向长时音视频故事与交互式世界生成

JoyAI-Echo-1.5 是一套面向长视频和交互式世界的音视频生成系统。长视频版本通过跨镜头记忆和从语音中提取的说话人信息,在多个场景中保持角色外观和声音身份的一致性。世界模型版本将导航输入转换为经过校准的六自由度摄像机轨迹,从而支持不同控制器和视角的交互。研究团队还将双向音视频骨干网络改造成因果式少步生成器,并利用模型自行生成的长短期 rollout 进行训练,以提高长时生成的效率和稳定性。根据论文报告,系统在跨镜头一致性、视觉质量、文本对齐和语音保真度方面优于现有基线。世界模型版本在 WBench 上取得 81.7 的平均分。上述结果来自作者自身评测,尚不能视为经过独立验证的行业标准表现。
行业资讯 应用 AI模型 研究 2026-08-27 14:01:02 875 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。