原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.07557
立即前往原文

CheckerBench:长程任务智能体能否合成静态分析检查器?

CheckerBench 是一项可执行基准测试,包含 300 项任务,涵盖 297 个 CVE、167 个代码仓库、85 种 CWE 类别和五种语言生态。它评估编程智能体能否根据缺陷说明和代码仓库构建可运行的静态分析检查器。在 21 种模型与 harness 配置中,平均 Pass@1 为 32.30%,最高为 45.33%。结果表明,对于当前编程智能体而言,开发可靠且可复用的检查器仍然具有挑战性。
行业资讯 应用 研究 2026-10-10 10:01:10 564 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。