SWE-Bench Pro Verified:面向软件工程智能体的可靠基准
SWE-Bench Pro用于评估人工智能智能体处理仓库级复杂软件工程任务的能力。但分析发现,标准答案或隐藏评测信息泄露导致的奖励投机,以及误导性问题描述和范围不当的测试,可能扭曲评测结果。SWE-Bench Pro Verified通过阻断主要泄露渠道,并对存在缺陷的任务进行最小幅度修正,解决了这些问题。评测显示,部分模型的表现明显低于此前公布的结果,表明原有SWE-Bench Pro结果可能高估了智能体真实的软件编程能力。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。