原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.06245
立即前往原文

VDiff-Bench:用于细粒度图像差异识别的高难度基准

VDiff-Bench用于评估多模态大语言模型(MLLM)识别相似图像细微差异的能力。该基准包含1,756道四选一题目,涵盖位置、颜色、文字、纹理、噪声和光照等10类变化。对11个开源和闭源MLLM的测试表明,模型在语义变化上的表现明显优于噪声、纹理等低层次差异。三款拥有70亿至80亿参数的开源模型在语义变化上的得分为52.5%至70.6%,但在低层次变化上的得分仅为8.7%至33.3%。VDiff-Bench揭示了模型在比较视觉理解方面的薄弱环节,而这些问题通常无法通过标准的单图视觉语言评测发现。
行业资讯 AI模型 研究 2026-09-10 02:31:12 380 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。