VGI-Bench:探究视频生成模型的视觉智能
VGI-Bench 是一个用于评估视频生成模型视觉推理能力的基准测试,包含 27 项任务和 810 个实例,并按任务领域和技能标签进行分类。评估结果显示,当前生成系统能够解决部分基于视觉的推理任务,但整体可靠性仍然不足。即使是表现最强的模型 Seedance 2.0,按照该研究的评估标准也只达到 51.0%。研究还分析了输出失败模式、对输入条件的敏感性、合成数据微调带来的性能迁移边界,以及去噪过程中有限的自我纠错能力:后续步骤主要是在完善早期假设,而不是纠正推理错误。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。