Evo-Bench:语言模型能否改进智能体框架?
Evo-Bench是一项用于评估语言模型能否自主优化AI智能体运行框架的基准测试。它覆盖搜索、办公和通用智能体任务,并试图将框架改进与基础模型能力区分开来。对9个前沿模型和开放权重模型的评估显示,最高绝对提升达到16.6分。自主进化在通用任务中超过人工构建的框架,在搜索任务上表现突出,但在需要高度特定处理流程的办公任务中表现较弱。研究还发现了早期饱和等时间异常,并表明生成的框架可以作为具有迁移性的推理结构,持续提升不同策略模型的表现。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。