原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.12289
立即前往原文

TestPrism:重新思考超越单一参考实现的测试评估

编程智能体生成的测试通常只针对一个参考实现进行评估,这可能忽略其他有效实现,并高估测试质量。TestPrism包含来自17个来源的300项测试任务和3,000个候选实现,有效与无效实现各占一半。其核心指标Joint Success Function要求测试在初始程序上失败、接受所有有效候选,并拒绝所有无效候选。在14种编程智能体配置中,该指标得分为28.00%,而单一参考评估的成功率为59.67%。分析发现了遗漏的行为、缺乏依据的断言以及构造不当的测试。研究还提出TestHelix,将测试与修复配对生成、同伴交叉验证和递归自我改进结合起来。在两个模型的评估中,与原生测试框架比较基线相比,TestHelix将该指标提高了8.67至9.00个百分点。
行业资讯 应用 研究 2026-10-09 18:01:00 986 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。