原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.25529
立即前往原文

Video-IFBench评估多模态大语言模型在视频理解中的指令遵循能力

该研究提出Video-IFBench,用于评估多模态大语言模型在视频理解过程中遵循指令的能力。基准包含1500个样本、32种任务类型,以及涵盖语义和格式要求的39类约束。研究人员测试了20多个近期模型,结果显示,当前模型在处理包含大量约束、语义要求,或需要根据视频和音频内容选择正确条件分支的复杂指令时,仍然面临明显困难。
行业资讯 AI模型 研究 2026-08-27 13:30:56 910 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。