英伟达推出1亿参数免费模型Nemotron3,支持最多8人实时说话人识别
英伟达发布了Nemotron3Diarization,这款免费模型约有1亿个参数,并开放权重,可识别实时及录制音频中的说话人,最多支持8人同时发声。英伟达称,该模型在VoiceArena语音分割基准测试v1中取得14.72%的错误率,优于排名第二系统的19.3%。在使用1.04秒音频缓冲区的8种测试场景中,其平均错误率较前代Streaming Sortformer降低41%。参与者增多、背景噪声较大或混响严重时,错误率可能上升。
本文来源:AIbase,仅供学习参考,版权归原作者所有。