ModaLens 测量报告条件下医学视觉语言模型的图像敏感性
ModaLens 评估:当模型已经获得放射学报告时,医学视觉语言模型是否仍真正使用影像。研究人员在 MIMIC-CXR 的 3,199 个配对病例中替换图像,同时固定问题和报告。对于 MedGemma-27B,有报告时生成答案仅在 4.26% 的试验中发生变化;没有报告时则为 20.94%,配对差异为 16.7 个百分点。相同方向的结果在另外两个模型系列中得到复现。由于标签来自报告,研究结果不能直接证明模型的视觉判读是否正确。研究团队公开了代码、完整提示词以及每个数据结果的运行记录。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。