原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.10636
立即前往原文

DistilVDR:通过双学生蒸馏实现的紧凑型端到端视觉文档检索器

DistilVDR 是一个拥有 5.24 亿参数的视觉文档检索系统,由一个 80 亿参数的视觉语言模型蒸馏而来。其非对称编码器将更多视觉处理能力集中在文档端,同时保持较小的查询编码器,并且无需相关性标注或负样本采样。HiRes 版本在 ViDoRe v1 至 v3 上取得 61.74 的平均 NDCG@5,达到教师模型性能的 86.9%。两个版本生成的索引都明显更小,为一百万份文档建立索引的速度约比可比的多向量基线快十倍。代码已在 GitHub 上公开。
行业资讯 应用 AI模型 研究 开源 2026-08-12 14:01:02 878 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。