PANORAMA:通过掩码候选选择实现全景接地描述
该研究针对全景接地描述任务,要求视觉语言模型同时描述前景物体和背景区域,并将每个短语关联到像素级掩码。作者推出了人工标注的 PanoCaps 基准,包含密集描述、近乎完整的像素覆盖以及实体级图文对齐,并提出 Generalized Panoptic Quality 评估指标。PANORAMA 使用预训练分割器生成由短语条件控制的掩码候选,再选择与每个短语对应的区域。在 PanoCaps 上,该模型取得了最佳整体接地效果,并在多项像素级接地任务中达到或超过专用模型。代码、数据和模型已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。