原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.23377
立即前往原文

从一到多,再从多到一:面向软件工程智能体的类别感知迭代式专家训练

该研究提出了一种改进人工智能智能体的方法,用于处理仓库级软件工程任务。由于将不同任务类别混合进行强化学习,可能导致部分类别进步、其他类别退步,研究人员首先训练各类别专家模型。Refresh-Repair-Expand迭代流程结合长期智能体强化学习、利用已验证的成功轨迹进行监督微调,以及自适应任务重选。随后,基于标签路由的多教师在线策略蒸馏将这些专家整合为一个可部署模型,只保留相对于参考策略的改进方向。该方法不需要外部模型提供解决方案轨迹或动作目标。最终策略在Pro-618上的解决率为58.04%,在SWE-bench Multilingual上为59.00%,较基础模型分别提升5.39和2.78个百分点。
行业资讯 应用 AI模型 研究 2026-09-22 10:31:13 254 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。