原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.15863
立即前往原文

LynnReal-Omni:面向智能体视觉工作流的原生多模态视频生成

LynnReal-Omni是一套多模态视频生成框架,通过共享的扩散Transformer统一处理文本、图像、外观参考、结构控制、可编辑3D场景和游戏状态等输入。其320亿参数模型支持文本生成视频、图像条件生成、参考引导生成、视频编辑、低质视频修复以及长视频生成。研究团队还推出了面向实时渲染的270亿参数模型LynnReal-Omni-Flash。配套的数据处理流程和MSAVP评测方案用于衡量指令遵循、视觉质量、生成合理性、时间一致性和音频协调。研究团队称,在单张H100上生成并解码一段540p、22帧的视频,标准版耗时843毫秒,Flash版耗时377毫秒。
行业资讯 应用 AI模型 研究 2026-09-15 16:32:37 379 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。