当模型修改过多:评估最小代码修改的忠实度
一项研究分析了大型语言模型在修复漏洞时为何经常修改超出必要范围的代码。研究人员使用 BigCodeBench 的 400 个问题,注入受控的 AST 级错误,以衡量修复结果是否接近最小补丁。即使是 GPT-5.5 等强大模型,也经常产生不必要的大幅修改并增加认知复杂度。加入保留原有代码的指令后,过度 Levenshtein 距离从 0.195 降至 0.131,新增认知复杂度降低 26.6%,Pass@1 提升 2.3 个百分点。在分布外场景中,强化学习在修改忠实度和性能保持之间取得了最佳平衡。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。