原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.33382
立即前往原文

WideSWE:编程智能体能否协调跨代码仓库的修改?

WideSWE是一项用于评估编程智能体的基准测试,重点关注需要在多个代码仓库中协调修改的软件开发任务。研究团队分析了103个软件生态系统,构建了120项真实任务,其中包括60项漏洞修复和60项功能开发。在7种智能体配置中,完整任务成功率介于10.83%和42.50%之间;结合Codex CLI与GPT-5.6-sol的配置表现最佳。结果显示,智能体经常无法识别所有必要修改、未完成已识别的工作,或虽然修改了相关仓库,却未完全满足需求。研究还比较了逐个独立处理仓库与联合执行两种方式。独立执行主要能够弥补遗漏的工作,而联合执行则可以利用相关仓库的信息来指导实现和验证。代码已在GitHub上公开。
行业资讯 应用 研究 开源 2026-09-29 14:30:58 159 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。