IdeaAMBIG:研究想法规范中实现关键缺口的基准测试
IdeaAMBIG评估研究方法规范是否包含足够信息,使具备能力的实施者或编程代理无需无依据的假设,就能构建出预期方法。该基准包含660个有证据支持的实例:163个来自可复现性报告和GitHub问题的真实缺口,以及497个注入可实现参考资料中的受控合成缺口。研究评估三项能力:判断规范是否适合编码、定位缺陷,以及生成澄清行动。在测试的13个大语言模型中,最佳模型在真实实例上的宏观缺陷恢复率仅为9.6%;但在获得缺陷信息后,其宏观澄清行动成功率达到80.6%。在一项提供标准答案的预言机研究中,提供正确解决方案使后续可编码率从14%提升至98%。结果表明,主要瓶颈是定位缺陷,而不是在缺陷已知后提出澄清方案。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。