DreamX-Creator 推动 2K 原生音视频生成普及
DreamX-Creator 1.0 是一套可联合生成视频和音频的紧凑型系统。其 70 亿参数生成器先分别处理视觉与音频流,再通过带门控的跨模态注意力机制进行耦合。系统采用经过筛选的时序一致多模态数据、渐进式联合训练,以及利用模态感知反馈的强化学习。针对 2K 输出,团队设计了一个精炼流程,将模型压缩为每个时间片段只需进行一次去噪评估。开发团队公开了 7B 生成器和 2K 精炼器,以支持统一音视频生成研究,并称其同步生成性能可与当前开源系统竞争。不过,提供的信息未列出具体基准测试结果。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。