TestPrism:重新思考超越单一参考实现的测试评估
编程智能体生成的测试通常只针对一个参考实现进行评估,这可能忽略其他有效实现,并高估测试质量。TestPrism包含来自17个来源的300项测试任务和3,000个候选实现,有效与无效实现各占一半。其核心指标Joint Success Function要求测试在初始程序上失败、接受所有有效候选,并拒绝所有无效候选。在14种编程智能体配置中,该指标得分为28.00%,而单一参考评估的成功率为59.67%。分析发现了遗漏的行为、缺乏依据的断言以及构造不当的测试。研究还提出TestHelix,将测试与修复配对生成、同伴交叉验证和递归自我改进结合起来。在两个模型的评估中,与原生测试框架比较基线相比,TestHelix将该指标提高了8.67至9.00个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。