RRSI:智能体框架的正则化递归自我改进
RRSI是一种自动改进基于大语言模型的智能体系统的方法,涵盖提示词、控制流程、工具、记忆和上下文管理。该方法旨在缓解过拟合问题,即系统在用于优化的任务上取得明显提升,却难以迁移到未见过的基准测试。RRSI限制每个候选方案可合并的修改数量,鼓励探索尚未尝试的改进路径,并通过批评器和剪枝器过滤特定于基准、成本过高或已失去作用的修改。在涵盖编程、智能体工作空间和工程设计的八项基准测试中,RRSI在优化数据划分上最高提升14.1分,在五项分布外基准测试上最高提升4.7分。与未进行正则化的进化方法相比,生成的智能体框架还减少了30%的策略token使用量。代码已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。