原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://www.ithome.com/0/997/218.htm
立即前往原文

Meta发布首个实时音频感知AI模型,支持20余人分轨转写

Meta推出Muse Voice Transcribe,这是其首个实时音频处理模型。开发者可通过Meta Model API调用,价格为每1000分钟音频3美元。该模型将流式自动语音识别、说话人分离和端点检测整合在同一流程中,可在用户说话时同步输出文字。它能在包含20多名说话人的录音中区分不同发言者,支持超过1小时的音频及句内、句间的自然语言切换。模型训练覆盖70多种语言,发布时已有25种语言完成验证。Meta称,截至2026年9月1日,该模型位列Artificial Analysis流式语音转文本排行榜第一。
行业资讯 应用 行业新闻 科技巨头 AI模型 2026-09-02 08:30:07 886 阅读 阅读约 1 分钟 来源:IT之家,AIbase
本文来源:IT之家,AIbase,仅供学习参考,版权归原作者所有。