ExecRetrieval 衡量代码嵌入检索中的功能正确性差距
ExecRetrieval 是一个用于测试代码嵌入系统能否区分功能正确代码与几乎相同但存在错误的代码变体的基准。数据集包含 939 个 Python 任务,每个任务配有一个经过执行验证的标准实现,以及最多四个通过单一目标修改生成、同样经过执行验证的错误干扰项。研究人员评估了 23 种密集嵌入配置和 BM25。表现最佳的托管系统 exec@10 达到 1.00,但 exec@1 仅为 0.331。在四个领先系统中,91.5% 至 99.4% 的首位误判选择了配对的错误变体。数据集、执行验证工具、嵌入矩阵、环境快照和统计检验数据将一并发布。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。