原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://www.ithome.com/1/001/260.htm
立即前往原文

小米开源目标说话人语音识别模型 Xiaomi-CocktailASR-1

小米发布并开源了 Xiaomi-CocktailASR-1,这是一款采用端到端 LLM 架构的自动语音识别模型,旨在解决多人同时说话时的“鸡尾酒会问题”。模型以一段参考音频作为目标说话人的声纹提示,即使在多人交谈的复杂环境中,也能提取并仅转录指定说话人的语音。小米表示,该模型在多个主流多说话人测试集上达到领先水平,单人识别性能可媲美标准 ASR 模型。此外,模型能够拒识非目标说话人的干扰语音,并在目标说话人不在场时输出空文本,从而减少误触发。模型和代码已通过 GitHub 与 Hugging Face 提供。
行业资讯 行业新闻 科技巨头 AI模型 研究 开源 2026-09-11 15:00:06 557 阅读 阅读约 1 分钟 来源:IT之家
本文来源:IT之家,仅供学习参考,版权归原作者所有。