EarlyEval通过提前预测结果降低AI智能体评估成本
评估大语言模型智能体的成本可能很高:前沿模型运行一次基准测试就可能花费数百至数千美元,反复测试会进一步增加开发成本。EarlyEval通过分析智能体的中间行为,提前预测其最终结果,并在成功或失败的置信度达到设定阈值时停止运行。该轻量级框架使用两个基于行为、文本和参考解决方案特征训练的LightGBM分类器。在SWE-bench Verified、TerminalBench和Toolathlon上,EarlyEval将智能体执行步骤减少了13%至26%,输入令牌最多减少44.1%,输出令牌最多减少29.4%。预测准确率达到89%至97%,而智能体解决率平均仅变化一至两个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。