原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.08760
立即前往原文

WorldSonus:为虚拟世界带来声音

WorldSonus是一种交互式视频转音频框架,旨在为世界模型实时生成声音。它采用流式因果自回归扩散架构,以0.41的实时因子分段合成音频。按片段安排提示词的机制可在生成过程中调整声音事件;立体声和高阶环绕声数据则用于实现空间对齐。研究团队称,WorldSonus在音质和空间对齐方面达到或超过双向模型,并能推广到开放领域的视频转音频任务。
行业资讯 AI模型 研究 2026-10-08 11:01:02 546 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。