SWE Refactor Bench:编程智能体能否完成长期的全代码库迁移?
SWE Refactor Bench评估编程智能体是否能真正执行整个软件代码库的技术迁移,而不仅是让现有测试通过。该基准包含20项迁移任务,覆盖四类技术债务,并检查迁移完成度、行为正确性以及隐藏的行为差异。在8个前沿模型的520次运行中,只有28次通过全部三个阶段,13项任务没有获得可接受的解决方案。表现最佳的Claude Opus 5得分为47.0分。结果显示,智能体经常跳过迁移,或在尝试迁移时破坏原有功能。不同迁移类型的表现差异明显:构建工具链重写得分31.4分,而语言迁移仅得5.6分。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。