原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.10720
立即前往原文

Ex-Omni-2D:具备原生视觉呈现能力的表现力全模态对话模型

Ex-Omni-2D 是一个多模态对话框架,可生成结合文本、个性化语音和参考条件视频的协调式响应。系统接收多模态查询、参考图像和音频后,先预测描述场景、情绪与动作的视觉思维计划,再生成响应文本和语音单元。共享的声学—时间接口能够将语音与视频帧对齐。研究人员将完整序列视频生成器蒸馏为更高效的流式模型,以支持增量生成。在四步推理和四张 GPU 的流水线中,系统在 400×720 或 720×400 分辨率下达到 1.293 的实时系数。
行业资讯 应用 AI模型 研究 2026-08-12 11:31:19 668 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。