原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.21465
立即前往原文

OmniVChat:原生音视频对话的合成、基准测试与训练

OmniVChat是一种对话形式:全模态模型直接同时接收用户的音频和视频,并以文本回复,不需要单独的文本问题、外部字幕生成或语音识别。由于真实用户录制数据稀缺,且开放式回答难以通过关键词匹配评估,研究团队提出多智能体数据引擎OmniVChat-Studio,用于合成单轮和多轮音视频对话。研究人员据此构建OmniVChat-Bench,评估五项基本对话能力,并提出OmniVChat-RL,在强化学习中同时优化回答的正确性、效率和风格。使用合成对话训练Qwen3-Omni-Instruct后,模型在合成基准和真人录制基准上的表现均有所提升,表明该方法可能迁移到真实场景对话。
行业资讯 应用 AI模型 研究 2026-09-21 18:01:08 139 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。