SWE-Bench ProMax 评估 AI 代理的大规模多语言代码重构能力
SWE-Bench ProMax 是一个由专家策划的基准测试,包含从真实提交中选取的 170 个代码重构任务,覆盖 Python、Java、TypeScript、Go、C、C++ 和 Rust 七种语言。该项目针对现有基准中的测试缺陷,以及模型可能从训练数据中逐字复现标准补丁等问题进行了改进。每个任务平均修改 11.4 个文件和 261.6 行代码,规模明显超过现有评测。在两种代理框架的实验中,最佳模型的解决率仅为 41.2%。该数据集现已公开发布。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。