关键不在图片展示了什么:无关语境会扰乱 VLM 评判,却没有提供信息
研究人员推出 MIST 压力测试,包含 200 个英文句子,其中的短语既可作比喻理解,也可按字面理解,评判应仅依据句子。在 13 个视觉语言模型(VLM)评判器中,尽管指示要求忽略图片,符合语境的图片和误导性图片都改变了约 20% 的标签。两种图片条件下不同的标签中,只有 37% 朝图片所呈现的含义移动。无论没有图片、图片与句意一致还是具有误导性,模型与人工标注者的一致度均未改变。结果表明,图片的存在本身就可能扰乱 VLM 判断;评估模型能否替代人工标注者时,也应考虑评测条件。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。