Ex-Omni-2D:具备原生视觉呈现能力的表现力全模态对话模型
Ex-Omni-2D 是一个多模态对话框架,可生成结合文本、个性化语音和参考条件视频的协调式响应。系统接收多模态查询、参考图像和音频后,先预测描述场景、情绪与动作的视觉思维计划,再生成响应文本和语音单元。共享的声学—时间接口能够将语音与视频帧对齐。研究人员将完整序列视频生成器蒸馏为更高效的流式模型,以支持增量生成。在四步推理和四张 GPU 的流水线中,系统在 400×720 或 720×400 分辨率下达到 1.293 的实时系数。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。