原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.10366
立即前往原文

DSAgentBench:智能体能否在真实计算机环境中自动完成端到端数据科学工作流?

DSAgentBench 是一个用于评估 AI 智能体在真实计算机环境中执行完整数据科学工作流的基准测试。它包含 275 项任务,覆盖数据整理、探索、建模、可视化和验证,并要求协调使用笔记本、IDE、终端、浏览器和数据库。确定性评估器不仅检查代码执行,还会验证分析正确性、可视化结果和模型性能。在对 15 个闭源和开源模型的实验中,表现最强的 Claude-4.6-Sonnet 任务成功率也只有 56.70%。所有开源智能体的成功率均低于 1%。常见失败原因包括工具编排、操作系统环境适应和多步骤推理。该基准测试已在 GitHub 上发布。
行业资讯 应用 研究 开源 2026-08-12 11:31:19 310 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。