动态 Harness 搜索:通过预测为每个查询构建多智能体系统
智能体 harness 定义了解决任务所需的角色、指令、工具和通信结构。由于只有执行后才能观察其效果,过去针对每个查询调整 harness 通常需要运行多个方案或进行昂贵的人工设计。研究人员推出 SHIFT,利用搜索结果训练本地大语言模型构建 harness,并根据准确率和执行成本预测其效用。对于每个查询,系统通过蒙特卡洛树搜索构建 harness,无需实际运行多个备选方案。在六个基准测试的 9,193 项任务中,以 Gemini 3.5 Flash 作为执行模型时,SHIFT 的平均准确率约为 80%,比 17 种基线方法高出最多 7.2 个百分点。低成本版本的平均准确率也超过所有基线方法,并比表现最强的基线少用 32% 的执行 token。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。