HelixWorld:实时交互式视听世界模型
HelixWorld是一种世界模型,可在用户实时交互过程中共同生成视觉场景和与摄像机视角对齐的空间立体声。该系统使用高保真视听数据集进行预训练,数据包含真实立体声声学、带尺度信息的摄像机姿态、六自由度摄像机轨迹以及用户操作。研究人员将双向教师模型蒸馏为低延迟流式学生模型,并报告称其可在单块GPU上以每秒24帧生成无漂移的视听推演结果。研究还提出HelixBench,用于评估合成声场是否能准确跟踪视点运动。论文称,HelixWorld的视觉质量和响应速度可与现有无声世界模型相当,同时在空间声学对齐方面明显优于基线系统。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。