LynnReal-Omni:面向智能体视觉工作流的原生多模态视频生成
LynnReal-Omni是一套多模态视频生成框架,通过共享的扩散Transformer统一处理文本、图像、外观参考、结构控制、可编辑3D场景和游戏状态等输入。其320亿参数模型支持文本生成视频、图像条件生成、参考引导生成、视频编辑、低质视频修复以及长视频生成。研究团队还推出了面向实时渲染的270亿参数模型LynnReal-Omni-Flash。配套的数据处理流程和MSAVP评测方案用于衡量指令遵循、视觉质量、生成合理性、时间一致性和音频协调。研究团队称,在单张H100上生成并解码一段540p、22帧的视频,标准版耗时843毫秒,Flash版耗时377毫秒。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。