SWE-bench Science:编程代理能否解决科学领域的工程任务?
SWE-bench Science 是一个面向代码仓库的基准测试,用于评估编程代理处理科学软件任务的能力。该基准涵盖来自 98 个 GitHub 仓库、20 个科学领域的 119 项任务,分为问题驱动、专家探索和工程集成三类场景。表现最佳的代理 Claude Code 搭配 Opus-5 (max),pass@1 仍低于 50%。研究发现四种常见失败机制:科学知识或抽象能力不足、探索方向错误或仅进行表层修复、修复覆盖范围或系统集成不完整,以及无法将科学知识推广到新案例。只有与任务准确匹配的科学指导,才能提升性能和令牌效率。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。