AuK:用于语音生成与编辑的开源基础模型
一份技术报告介绍了 AuK,这是一款通过自然语言指令和音频上下文统一语音生成与音频编辑的开源基础模型。该模型使用约 30.3 亿条指令—音频实例进行训练,相当于 195 万小时的有效监督数据,覆盖语音生成、内容编辑、增强与分离、副语言编辑和声学编辑五类任务。AuK 将多模态大语言模型、在语音、通用音频和音乐上联合训练的 VAE,以及混合式 Rectified Flow Transformer 结合起来。蒸馏版本 AuK-Flash 无需 Classifier-Free Guidance 即可进行四步推理;在匹配条件下,其实际运行速度据称是完整模型的 4.5 倍。实验显示,该模型在零样本和指令控制语音生成,以及通用指令引导编辑方面表现领先。研究团队同时发布了源代码和模型权重。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。