学习用于推理时智能体运行环境设计的元技能
智能体的表现既取决于推理能力,也取决于其运行环境。本研究探讨在两个模型的权重保持不变时,Builder 如何为 Target 构建更好的执行环境。Builder 根据 Target 的执行反馈学习可复用的元技能,用于判断何时需要支持以及应提供哪些资源。在未见过的任务上,完整元技能库使 Harness-Bench 和 NewtonBench 的平均表现较不使用技能提升 8.95 个百分点,较将同一技能库直接提供给 Target 提升 12.02 个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。