AnswerMap:基于回答后验概率实现 VLM 的忠实空间可解释性
AnswerMap 是一种无需训练、与任务无关的黑盒方法,可根据输出概率为空间语言模型(VLM)的回答生成空间解释。该方法将图像切分成条带,逐一与是非式相关性问题一同输入模型,再把所得概率组合为空间图。在涵盖四个模型和三种查询分布的测试中,AnswerMap 与模型所指位置的一致性高于注意力图(AUC 为 0.85,而注意力图为 0.38)。移除图中标出的区域后,53% 的正确回答发生变化;注意力图对应的比例为 19%。研究人员还展示了该方法可标记幻觉物体、定位目标,并通过将标记区域重新输入模型来纠正部分错误回答。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。