原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.15698
立即前往原文

ConceptFormer:面向视觉文档检索中查询—文档对齐的自适应潜在概念学习

ConceptFormer 是一个用于视觉文档检索的研究框架,也是多模态检索增强生成的重要组成部分。该方法将与查询相关的证据表示为由查询条件化的连续潜在概念,在不依赖文本中间表示或直接视觉标注的情况下,连接局部视觉证据与语义相关性。训练过程中,强大的视觉语言模型会动态确定潜在概念标记的数量,并利用这些概念指导嵌入空间学习。在多个视觉文档检索基准测试中,ConceptFormer 的平均 NDCG@10 比最强视觉检索基线提升 16.7%,比最强 OCR 文本检索基线提升 22.1%。研究还表明,该方法能够同时捕捉细粒度文本线索和复杂的文档级视觉结构。代码和数据已公开。
行业资讯 应用 研究 开源 2026-08-18 11:30:56 309 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。