原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.07886
立即前往原文

将视觉语言落地建模为双向概念对应

一项新研究将视觉语言落地定义为视觉指涉文本片段与图像中实例级区域之间的双向对应。与传统方法不同,该方法不假设相关文本片段已经被预先标注。研究提出的 ConCor-1 模型利用可学习的桥接标记,预测文本掩码、图像掩码以及对应关系是否存在。研究人员还将多个落地和分割数据集转换为统一的对应格式。在实验中,ConCor-1 在长描述数据集上的对应 F1 指标较基线提升 48%;在以大型类别列表作为文本输入的 LVIS 零样本评估中提升 29%。
行业资讯 AI模型 研究 2026-08-11 16:01:02 370 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。