科大讯飞发布 Spark-Audio-1.0-Preview,基于全国产化算力训练的语音基座大模型
科大讯飞发布了 Spark-Audio-1.0-Preview,这是一款完全基于中国自主研发算力基础设施训练的多模态语音基座大模型。与先将语音转换为文字的传统级联方案不同,该模型可直接处理人声、环境音和音乐,并尝试理解其中的语义、情绪与场景。模型采用 0.65B Dense 音频编码器和 30B-A3B MoE 大语言模型,使用 1300 万小时音频及大量文本数据训练。它支持 99 种语言和 202 种方言,可执行语音转写、多语言翻译、说话人识别、环境音识别、情感分析及复杂音频问答等任务。科大讯飞称,该模型在多项语音评测中整体达到或超过对比模型,并在中文 Fleurs 测试集取得 SOTA。相关结果来自公司公布的评测。模型目前已开放体验,API 后续将上线讯飞开放平台。
本文来源:IT之家,AIbase,仅供学习参考,版权归原作者所有。