原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.05034
立即前往原文

Agentic RAG 评估:在问题、搜索轨迹和重复读取之间分配预算

本研究考察如何将 Agentic RAG 的评估预算分配给问题、搜索轨迹和重复回答。在 HotpotQA 和 MuSiQue 上,使用相近的 token 预算扩大问题覆盖范围,相比读取五次使标准误降低 33%,相比三条搜索轨迹降低 12.6%。两种预测方法对预算分配的预测误差不超过 4%。超过两条轨迹的审计后,未发现明确的预测优势。根据记录的模型费用,当搜索成本为每 1,000 次请求 0 至 1 美元时,增加问题数比增加搜索轨迹更划算;增加问题与增加读取次数的成本比较仍无定论。将温度设为 0 后,答案分歧率从 14.3% 降至 3.4%,比较精度则基本相近。
行业资讯 研究 2026-10-08 11:01:01 445 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。