面向多模态大语言模型细粒度感知的区域级策略优化
Vision-RL2 在避免大幅增加视觉 token 成本的同时,提升多模态大语言模型(MLLM)的细粒度视觉感知能力。该方法先从压缩视图中定位相关区域,再将更高分辨率集中到选定证据上。研究人员通过区域级强化学习优化轻量级候选区域网络,并使用冻结的 MLLM 读取器评估各区域对答案的贡献。在六个细粒度基准和四个 MLLM 骨干模型上,Vision-RL2 在所有视觉 token 预算下都提升了准确率,并以约四分之一的视觉 token 达到最大预算配置的准确率。代码已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。