原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.19745
立即前往原文

面向多模态大语言模型细粒度感知的区域级策略优化

Vision-RL2 在避免大幅增加视觉 token 成本的同时,提升多模态大语言模型(MLLM)的细粒度视觉感知能力。该方法先从压缩视图中定位相关区域,再将更高分辨率集中到选定证据上。研究人员通过区域级强化学习优化轻量级候选区域网络,并使用冻结的 MLLM 读取器评估各区域对答案的贡献。在六个细粒度基准和四个 MLLM 骨干模型上,Vision-RL2 在所有视觉 token 预算下都提升了准确率,并以约四分之一的视觉 token 达到最大预算配置的准确率。代码已公开。
行业资讯 AI模型 研究 开源 2026-09-18 11:01:04 882 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。