原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.09096
立即前往原文

Evo-Bench:语言模型能否改进智能体框架?

Evo-Bench是一项用于评估语言模型能否自主优化AI智能体运行框架的基准测试。它覆盖搜索、办公和通用智能体任务,并试图将框架改进与基础模型能力区分开来。对9个前沿模型和开放权重模型的评估显示,最高绝对提升达到16.6分。自主进化在通用任务中超过人工构建的框架,在搜索任务上表现突出,但在需要高度特定处理流程的办公任务中表现较弱。研究还发现了早期饱和等时间异常,并表明生成的框架可以作为具有迁移性的推理结构,持续提升不同策略模型的表现。
行业资讯 应用 AI模型 研究 2026-08-11 11:30:57 618 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。