CheckerBench:长程任务智能体能否合成静态分析检查器?
CheckerBench 是一项可执行基准测试,包含 300 项任务,涵盖 297 个 CVE、167 个代码仓库、85 种 CWE 类别和五种语言生态。它评估编程智能体能否根据缺陷说明和代码仓库构建可运行的静态分析检查器。在 21 种模型与 harness 配置中,平均 Pass@1 为 32.30%,最高为 45.33%。结果表明,对于当前编程智能体而言,开发可靠且可复用的检查器仍然具有挑战性。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。