HLA-WM:面向长时域视频世界模型的混合线性注意力
HLA-WM 是一种无需额外训练、用于改进视频世界模型长期记忆的方法。它将基于摄像机几何信息的粗粒度历史场景检索,与递归线性注意力状态计算相结合,从而在不保存持续增长的完整 KV 缓存的情况下,有选择地重建相关历史场景。在 60 秒上下文的 SANA-WM-Bench 上,HLA-WM 提升了场景重访一致性和摄像机控制的全部六项指标,其中 PSNR 提高 0.74 dB,旋转误差降低 28.5%。在 547 个样本上评估的 MBench-A 中,三项重访一致性指标也均有所提升。历史状态内存降至完整 KV 缓存的十二分之一,而推理吞吐量最多仅下降 1.6%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。