将视觉语言落地建模为双向概念对应
一项新研究将视觉语言落地定义为视觉指涉文本片段与图像中实例级区域之间的双向对应。与传统方法不同,该方法不假设相关文本片段已经被预先标注。研究提出的 ConCor-1 模型利用可学习的桥接标记,预测文本掩码、图像掩码以及对应关系是否存在。研究人员还将多个落地和分割数据集转换为统一的对应格式。在实验中,ConCor-1 在长描述数据集上的对应 F1 指标较基线提升 48%;在以大型类别列表作为文本输入的 LVIS 零样本评估中提升 29%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。