原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.34899
立即前往原文

ColNanoVDR 实现多向量视觉文档检索中的无文档查询蒸馏

ColNanoVDR 是一个将视觉语言模型大型查询编码器蒸馏为小型模型的框架,面向视觉文档检索。不同于需要编码并缓存所有训练页面的传统方法,它仅使用教师模型的查询嵌入训练学生模型。其 OTW 目标通过带熵正则的最优传输和可学习的令牌权重,对齐教师与学生的查询令牌,且不要求两者采用对应的分词方式。基于五个先进教师模型蒸馏出的 1.49 亿参数纯文本学生模型,在 ViDoRe v1 至 v3 上保留了教师模型约 95% 的 NDCG@5 性能。查询编码速度最高提升 26 倍;在相同训练条件下,OTW 达到与分数蒸馏相当的效果,同时无需编码页面,并将缓存的教师数据减少 12.6 倍。
行业资讯 应用 研究 2026-09-29 15:01:09 414 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。