原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.27831
立即前往原文

RealSWE:基于真实用户请求评估编程智能体

该研究分析了 SWE-bench 基准任务与编程智能体实际收到的用户请求之间的差距。真实提示词中有 88% 仅包含问题描述或有限的额外上下文,而基准任务中符合这一结构的比例只有 7%。此外,87% 的真实请求使用较为口语化的表达,94% 的基准问题则采用正式文体。研究人员推出 RealSWE,包含 381 个任务族,并对信息组成和语言风格进行受控变化。在七个当代大语言模型上的测试显示,更贴近现实的输入会使解决率平均下降 6.4 个百分点,并可能改变模型排名。明确说明期望行为和提出问题的动机会显著提升性能;环境信息和复现步骤虽然增加了输入长度,却没有带来可测量的收益。
行业资讯 应用 研究 2026-09-03 09:01:25 219 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。