原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.08345
立即前往原文

CoVeR:面向视觉语言模型多视图三维推理的覆盖度令牌剪枝

多视图图像让二维视觉语言模型能够利用预训练知识推理三维场景,但也会产生数千个冗余视觉令牌。CoVeR是一种确定性、无需训练的选择方法,仅使用令牌坐标来最大化空间覆盖度。它能够执行精确的令牌预算,并避免选择近乎重复的令牌。在四个视觉语言模型上测试时,CoVeR在三个三维推理基准上均超过此前的最佳方法。仅使用约8%的视觉令牌,它仍保留了完整令牌配置下93.5%的性能,并在各基准上的平均成绩上领先此前最佳方法3.9个百分点。
行业资讯 AI模型 研究 2026-09-09 14:31:01 703 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。