超越语义相似度:复杂任务中智能体检索的性能与成本
这项研究评估了智能体检索:通过 ReAct 循环结合大型语言模型的推理能力与检索系统,以处理复杂搜索任务。在使用相同嵌入模型的情况下,该方法的 nDCG@10 比标准检索提高了 8.7 分,并在 ViDoRe v3 和 BRIGHT 榜单上取得有竞争力的结果。但性能提升伴随着显著成本:每次查询平均耗时 107.4 秒,而标准检索仅需 0.67 秒;每次查询还消耗 764,100 个输入 token 和 5,800 个输出 token。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。