ConceptFormer:面向视觉文档检索中查询—文档对齐的自适应潜在概念学习
ConceptFormer 是一个用于视觉文档检索的研究框架,也是多模态检索增强生成的重要组成部分。该方法将与查询相关的证据表示为由查询条件化的连续潜在概念,在不依赖文本中间表示或直接视觉标注的情况下,连接局部视觉证据与语义相关性。训练过程中,强大的视觉语言模型会动态确定潜在概念标记的数量,并利用这些概念指导嵌入空间学习。在多个视觉文档检索基准测试中,ConceptFormer 的平均 NDCG@10 比最强视觉检索基线提升 16.7%,比最强 OCR 文本检索基线提升 22.1%。研究还表明,该方法能够同时捕捉细粒度文本线索和复杂的文档级视觉结构。代码和数据已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。