原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.01865
立即前往原文

ExecRetrieval 衡量代码嵌入检索中的功能正确性差距

ExecRetrieval 是一个用于测试代码嵌入系统能否区分功能正确代码与几乎相同但存在错误的代码变体的基准。数据集包含 939 个 Python 任务,每个任务配有一个经过执行验证的标准实现,以及最多四个通过单一目标修改生成、同样经过执行验证的错误干扰项。研究人员评估了 23 种密集嵌入配置和 BM25。表现最佳的托管系统 exec@10 达到 1.00,但 exec@1 仅为 0.331。在四个领先系统中,91.5% 至 99.4% 的首位误判选择了配对的错误变体。数据集、执行验证工具、嵌入矩阵、环境快照和统计检验数据将一并发布。
行业资讯 应用 AI模型 研究 开源 2026-09-03 10:30:58 941 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。