原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.05608
立即前往原文

Kandinsky 6.0 Video:用于同步生成视频与音频的基础模型

Kandinsky 6.0 Video 是一系列可生成 5 秒视频的基础模型,支持同步生成 44 kHz 音频和口型,包括唇形同步。Lite 和 Pro 版本分别拥有 30 亿和 290 亿参数,支持文生音视频和图生音视频。内置超分辨率模型可将输出提升至全高清分辨率。该系统采用双流 CrossDiT 架构,通过双向交叉注意力连接视频流与音频流。开发团队以 MIT 许可证发布代码、模型检查点和 Diffusers 集成。
行业资讯 应用 AI模型 研究 开源 2026-10-06 11:30:58 375 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。