原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://www.aibase.com/zh/news/30220
立即前往原文

英伟达发布首款开源全双工语音模型 VoiceChat 11B

英伟达发布了 NemotronLabs VoiceChat 11B,这是一款面向实时语音对话的开源端到端模型。不同于传统上将自动语音识别、大语言模型和语音合成串联起来的架构,VoiceChat 11B通过统一网络直接完成流式语音理解与生成。据英伟达介绍,该模型的轮次切换延迟最低可达448毫秒,并支持全双工交互,用户可以在对话过程中插话。模型还支持对话期间调用工具,并通过独立输出通道在处理外部API请求时播放预设的等待话术,从而减少长时间静默。不过,其部署仍受到限制:高效运行需要至少配备80GB显存的高性能GPU,官方目前仅将其标注为研究用途,也尚未提供成熟的托管API。
行业资讯 应用 行业新闻 科技巨头 AI模型 开源 2026-08-10 16:01:20 762 阅读 阅读约 1 分钟 来源:AIbase
本文来源:AIbase,仅供学习参考,版权归原作者所有。