面向视频世界模型的可寻址记忆
该研究探讨交互式视频世界模型如何在长时间范围内保存和检索视觉信息。当生成过程超出训练时长范围后,传统键值(KV)缓存中的内容将难以可靠寻址;直接压缩旋转位置编码后的缓存也可能破坏位置信息。研究提出无需重新训练的WorldTrace记忆框架,为每个压缩记忆槽分配一个位于训练分布内的独立虚拟位置。WorldTrace-Field压缩历史信息以保持时间连贯性,WorldTrace-Landmark则在检测到场景转换时保存原始场景轨迹,用于情节回忆。研究团队还推出LoopBench,评估模型在长时间绕行后重建曾访问场景的能力。在该基准上,两种方法分别将时间一致性提升15.5%,将情节回忆提升19.5%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。