CoVeR:面向视觉语言模型多视图三维推理的覆盖度令牌剪枝
多视图图像让二维视觉语言模型能够利用预训练知识推理三维场景,但也会产生数千个冗余视觉令牌。CoVeR是一种确定性、无需训练的选择方法,仅使用令牌坐标来最大化空间覆盖度。它能够执行精确的令牌预算,并避免选择近乎重复的令牌。在四个视觉语言模型上测试时,CoVeR在三个三维推理基准上均超过此前的最佳方法。仅使用约8%的视觉令牌,它仍保留了完整令牌配置下93.5%的性能,并在各基准上的平均成绩上领先此前最佳方法3.9个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。