原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.14462
立即前往原文

AlayaVista:从全景状态到透视视频的流式世界建模

AlayaVista是一种可由摄像机控制的流式视频世界模型,旨在保持广泛的场景上下文,同时生成高保真的透视视图。系统从单张透视图像出发,利用预训练的全景扩展模型构建360度场景先验,并将其作为受摄像机条件控制的全景潜在状态持续演化。潜在视口渲染器将该状态转换为指定视角的视频潜在表示,透视细化模块则负责恢复细节、抑制伪影并进行超分辨率。为实现高效流式生成,研究团队将全景生成改造为分块自回归生成,并将全景生成和透视细化都蒸馏为少步过程。此外,研究还构建了MUGEN数据集,包含1,318小时真实全景视频,分辨率至少为4K,并配有丰富的语义和几何标注。
行业资讯 应用 AI模型 研究 2026-09-15 15:01:03 672 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。