VideoLoop:以循环式工作记忆缓解长视频智能体的语义混乱
理解长视频需要多模态智能体经过多个推理步骤持续收集证据。然而,只能不断追加内容的工作记忆可能积累噪声,让智能体难以找到关键线索。研究团队提出 VideoLoop:外层循环负责推理视频,内层循环则在每一步之后检索过往观察和分析,并重写容量有限的工作记忆。实验中,VideoLoop 提升了四种常用 LVLM 骨干模型的表现,在 VideoMME(long)上平均比基线高 4.2 个百分点。面对最难的四分之一问题,只读取智能体上下文的评判者答对率为 81.1%,而仅追加式记忆的智能体为 60.9%。搭配 Gemini 3.1 Pro 时,VideoLoop 在 VideoMME(long)上达到 88.3%,在 VideoMMMU 上达到 88.8%,在 LongVideoBench(long)上达到 80.9%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。