原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.37863
立即前往原文

关键不在图片展示了什么:无关语境会扰乱 VLM 评判,却没有提供信息

研究人员推出 MIST 压力测试,包含 200 个英文句子,其中的短语既可作比喻理解,也可按字面理解,评判应仅依据句子。在 13 个视觉语言模型(VLM)评判器中,尽管指示要求忽略图片,符合语境的图片和误导性图片都改变了约 20% 的标签。两种图片条件下不同的标签中,只有 37% 朝图片所呈现的含义移动。无论没有图片、图片与句意一致还是具有误导性,模型与人工标注者的一致度均未改变。结果表明,图片的存在本身就可能扰乱 VLM 判断;评估模型能否替代人工标注者时,也应考虑评测条件。
行业资讯 伦理与安全 AI模型 研究 2026-10-02 02:02:52 809 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。