阶跃发布 StepAudio 3 系列语音大模型,称在多项全球基准中排名第一
中国 AI 公司阶跃发布 StepAudio 3 系列,包含 StepAudio3Realtime、ASR、TTS、Gen 和 Music 五款模型。公司称,多款模型在 Artificial Analysis 榜单中位列全球第一。该系列覆盖实时语音交互、语音识别与合成、完整音频内容生成和音乐创作。StepAudio3Realtime 支持原生全双工对话、用户打断、推理与语音生成并行,以及不阻塞当前会话的异步工具调用。StepAudio3ASR 面向中文、英文、方言、中英混说、专业术语和复杂声音环境,阶跃称其在 Artificial Analysis 语音识别基准中的词错误率为 1.7%,并列全球第一。TTS 重点提升自然语调,并支持笑声、迟疑等副语言表现。Gen 可统一生成声音、音效、环境音和背景音乐。Music 支持根据歌词、清唱、参考音频或 ABC 记谱法进行多轮音乐创作。五款模型目前均已上线阶跃星辰开放平台。
本文来源:IT之家,AIbase,仅供学习参考,版权归原作者所有。