DistilVDR:通过双学生蒸馏实现的紧凑型端到端视觉文档检索器
DistilVDR 是一个拥有 5.24 亿参数的视觉文档检索系统,由一个 80 亿参数的视觉语言模型蒸馏而来。其非对称编码器将更多视觉处理能力集中在文档端,同时保持较小的查询编码器,并且无需相关性标注或负样本采样。HiRes 版本在 ViDoRe v1 至 v3 上取得 61.74 的平均 NDCG@5,达到教师模型性能的 86.9%。两个版本生成的索引都明显更小,为一百万份文档建立索引的速度约比可比的多向量基线快十倍。代码已在 GitHub 上公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。