Realtime-Venus:支持异步委派的全双工交互系统
Realtime-Venus是一套面向音频和视频交互的主动式全双工系统,由两个分别训练、各含90亿参数的模型组成:用于视听交互的Realtime-Venus-Omni,以及用于语音交互的Realtime-Venus-Audio。两款模型通过共享因果时间线,整合连续感知、对话控制和原生语音生成。双循环运行环境可在对话持续进行的同时,异步执行后台推理和工具调用。根据公布的评测结果,Omni在8项视频基准测试中的6项取得最高分。Audio在多项音频理解和语音问答测试中领先,并在衡量应对用户打断及背景语音时对话延续能力的三项指标上超过Gemini 3.1 Live和GPT-4o。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。