原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.06293
立即前往原文

VepAgent结合工具增强强化学习预测视频事件

VepAgent是一种用于预测视频未来事件的智能体框架,将因果推理与工具增强强化学习结合起来,以推断已观察场景与后续事件之间的转变。该方法使用FutureBench-4K数据集进行监督微调,并在推理时调用状态跟踪、帧检索和图像区域放大等工具。据论文报告,在FutureBench和NEPBench评测中,VepAgent取得领先表现,优于规模更大的多模态语言模型。相关结论基于论文所述的基准测试。
行业资讯 研究 2026-10-08 15:01:08 565 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。