原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.38119
立即前往原文

VideoLoop:以循环式工作记忆缓解长视频智能体的语义混乱

理解长视频需要多模态智能体经过多个推理步骤持续收集证据。然而,只能不断追加内容的工作记忆可能积累噪声,让智能体难以找到关键线索。研究团队提出 VideoLoop:外层循环负责推理视频,内层循环则在每一步之后检索过往观察和分析,并重写容量有限的工作记忆。实验中,VideoLoop 提升了四种常用 LVLM 骨干模型的表现,在 VideoMME(long)上平均比基线高 4.2 个百分点。面对最难的四分之一问题,只读取智能体上下文的评判者答对率为 81.1%,而仅追加式记忆的智能体为 60.9%。搭配 Gemini 3.1 Pro 时,VideoLoop 在 VideoMME(long)上达到 88.3%,在 VideoMMMU 上达到 88.8%,在 LongVideoBench(long)上达到 80.9%。
行业资讯 应用 AI模型 研究 2026-09-30 12:31:10 929 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。