英伟达发布首款开源全双工语音模型 VoiceChat 11B
英伟达发布了 NemotronLabs VoiceChat 11B,这是一款面向实时语音对话的开源端到端模型。不同于传统上将自动语音识别、大语言模型和语音合成串联起来的架构,VoiceChat 11B通过统一网络直接完成流式语音理解与生成。据英伟达介绍,该模型的轮次切换延迟最低可达448毫秒,并支持全双工交互,用户可以在对话过程中插话。模型还支持对话期间调用工具,并通过独立输出通道在处理外部API请求时播放预设的等待话术,从而减少长时间静默。不过,其部署仍受到限制:高效运行需要至少配备80GB显存的高性能GPU,官方目前仅将其标注为研究用途,也尚未提供成熟的托管API。
本文来源:AIbase,仅供学习参考,版权归原作者所有。