StepAudio 3 Music 技术报告
StepAudio 3 Music 是一款支持显式音乐规划和开放领域文本控制的大规模长时音乐生成模型。系统结合了 50Hz 音乐分词器、基于流匹配的扩散 Transformer,以及可生成 48kHz 音频的 VAE 解码器。混合专家自回归模型会先使用 ABC 记谱法生成编曲计划,再预测音乐分词,将和声、节奏和旋律纳入生成上下文。模型支持歌曲、器乐曲、根据干声生成伴奏,以及最长 5 分 30 秒的翻唱合成。报告称其在多项音频评测中取得较好结果,并在 Artificial Analysis Music Arena Vocals 初步排行榜获得 1105 的 Quality Elo,但仍落后于 Suno V5.5 和 Mureka。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。