VDiff-Bench:用于细粒度图像差异识别的高难度基准
VDiff-Bench用于评估多模态大语言模型(MLLM)识别相似图像细微差异的能力。该基准包含1,756道四选一题目,涵盖位置、颜色、文字、纹理、噪声和光照等10类变化。对11个开源和闭源MLLM的测试表明,模型在语义变化上的表现明显优于噪声、纹理等低层次差异。三款拥有70亿至80亿参数的开源模型在语义变化上的得分为52.5%至70.6%,但在低层次变化上的得分仅为8.7%至33.3%。VDiff-Bench揭示了模型在比较视觉理解方面的薄弱环节,而这些问题通常无法通过标准的单图视觉语言评测发现。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。