原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.05739
立即前往原文

HLA-WM:面向长时域视频世界模型的混合线性注意力

HLA-WM 是一种无需额外训练、用于改进视频世界模型长期记忆的方法。它将基于摄像机几何信息的粗粒度历史场景检索,与递归线性注意力状态计算相结合,从而在不保存持续增长的完整 KV 缓存的情况下,有选择地重建相关历史场景。在 60 秒上下文的 SANA-WM-Bench 上,HLA-WM 提升了场景重访一致性和摄像机控制的全部六项指标,其中 PSNR 提高 0.74 dB,旋转误差降低 28.5%。在 547 个样本上评估的 MBench-A 中,三项重访一致性指标也均有所提升。历史状态内存降至完整 KV 缓存的十二分之一,而推理吞吐量最多仅下降 1.6%。
行业资讯 AI模型 研究 2026-10-06 21:00:58 564 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。