小米开源目标说话人语音识别模型 Xiaomi-CocktailASR-1
小米发布并开源了 Xiaomi-CocktailASR-1,这是一款采用端到端 LLM 架构的自动语音识别模型,旨在解决多人同时说话时的“鸡尾酒会问题”。模型以一段参考音频作为目标说话人的声纹提示,即使在多人交谈的复杂环境中,也能提取并仅转录指定说话人的语音。小米表示,该模型在多个主流多说话人测试集上达到领先水平,单人识别性能可媲美标准 ASR 模型。此外,模型能够拒识非目标说话人的干扰语音,并在目标说话人不在场时输出空文本,从而减少误触发。模型和代码已通过 GitHub 与 Hugging Face 提供。
本文来源:IT之家,仅供学习参考,版权归原作者所有。