HarnessDev:大语言模型能否创建并进化自己的智能体框架?
HarnessDev 是一个用于评估语言模型能否构建和改进智能体执行基础设施的基准测试。在创建阶段,智能体从最小化的初始环境出发,建立完整的执行系统;在进化阶段,则根据执行反馈反复修改该系统。研究评估了 6 个大语言模型,覆盖 4 个领域和 5 个下游基准,共包含 2,207 个独立实例。生成的框架在编程、搜索和研究任务上明显落后于成熟的人工设计系统,但在写作和机器学习实验方面,表现达到或超过了部分参考系统。进化过程带来了一些性能提升,但结果不稳定,对未参与开发的任务只能部分泛化。此外,性能高度依赖执行该框架的模型,说明不同模型之间的迁移能力有限。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。