Meta发布首个实时音频感知AI模型,支持20余人分轨转写
Meta推出Muse Voice Transcribe,这是其首个实时音频处理模型。开发者可通过Meta Model API调用,价格为每1000分钟音频3美元。该模型将流式自动语音识别、说话人分离和端点检测整合在同一流程中,可在用户说话时同步输出文字。它能在包含20多名说话人的录音中区分不同发言者,支持超过1小时的音频及句内、句间的自然语言切换。模型训练覆盖70多种语言,发布时已有25种语言完成验证。Meta称,截至2026年9月1日,该模型位列Artificial Analysis流式语音转文本排行榜第一。
本文来源:IT之家,AIbase,仅供学习参考,版权归原作者所有。