EviRank:用于多模态图像重排序的结构化相关性证据
EviRank 将多模态图像重排序建模为语义约束满足问题。系统会把纯文本、纯图像或组合查询解析为结构化证据包,其中包含实体、属性和关系等条件,并将其标记为必需、禁止或可忽略。该免训练方法结合确定性的规则评分与基于证据的列表比较,对候选图像进行验证。在涵盖文本到图像、图像到图像及组合检索的五个基准测试中,作者报告了业界领先的性能。通过知识蒸馏得到的轻量学生模型在显著降低成本的同时,保留了教师模型超过90%的能力。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。