WorldSonus:为虚拟世界带来声音
WorldSonus是一种交互式视频转音频框架,旨在为世界模型实时生成声音。它采用流式因果自回归扩散架构,以0.41的实时因子分段合成音频。按片段安排提示词的机制可在生成过程中调整声音事件;立体声和高阶环绕声数据则用于实现空间对齐。研究团队称,WorldSonus在音质和空间对齐方面达到或超过双向模型,并能推广到开放领域的视频转音频任务。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。