StepAudio 3 Gen 技术报告
该技术报告介绍了 StepAudio 3 Gen,一种通用音频生成模型,支持零样本文本转语音、声音设计、歌声生成、音效、音乐,以及多种音频类型的混合生成。与近期常见的连续扩散模型不同,该模型直接在残差向量量化(RVQ)令牌上进行离散自回归建模。其共享表示同时编码语义和声学信息。模型沿时间轴预测第一个码本,再由轻量级因果 Transformer 生成其余15个码本。研究重点包括考虑干扰的渐进式预训练、RVQ 适配器,以及跨音频领域的共享离散建模。作者声称该模型在语音合成和声音设计方面达到领先水平,同时具备生成语音、歌声、音效和音乐的能力,但这些结果尚未在此独立验证。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。