PILOT 在环:面向长程智能体的实时自我改进
PILOT 是一种监督者—工作者框架,支持 AI 智能体在执行过程中持续改进。独立的监督者可以在工作者运行期间重新引导或终止任务,同时将执行过程中发现的流程和失败模式提炼为可复用的技能与记忆。在两个冻结的基础模型和三个基准测试中,PILOT 在六种配置中的五种排名第一。在 Terminal-Bench 2.0 上,其表现最多领先对比框架 9.8 个百分点。在自我改进测试中,使用 GLM-5.1 和 Kimi-K2.6 时分别提升 14.6 和 12.4 个百分点;输出 token 数则减少了 42.9% 和 47.4%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。