原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.09134
立即前往原文

代理框架与模型协同进化:在模仿失效时,在线策略纠错帮助较弱模型追赶

代理框架包括系统提示词、工具、执行钩子和上下文管理,对代理任务的成功率有重要影响。在七项企业代理任务中,自动进化的框架让较小模型以远低于前沿模型的成本取得了良好表现。但使用强模型专家的完整执行轨迹训练较弱模型后,性能反而下降了4至30个百分点。原因是较弱模型模仿了专家的规划策略,却缺乏执行该策略的能力,同时破坏了与原本依据其规划风格设计的框架之间的适配关系。研究人员提出一种在线策略纠错流程:由元级代理定位较弱模型自身执行中的失败步骤,再让专家只重写该步骤。该方法保留模型原有的规划风格,并结合框架进化与针对性的模型适配,从而以更低成本提升特定领域企业代理的性能。
行业资讯 应用 AI模型 研究 2026-09-10 12:01:06 920 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。