原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.17800
立即前往原文

StartupBench:基于市场验证的端到端工作流评测通用智能体

StartupBench是一项评估AI智能体执行完整真实工作流程能力的基准测试。它不主要依赖研究人员挑选的任务,而是以已证明拥有用户采用率和实际需求的AI产品为基础,覆盖多个专业领域。研究人员将这些工作流转化为面向交付成果的任务,并通过细致的评分标准进行评估。即使是测试中表现最强的模型,也只能完整完成约30%的任务,尽管在许多任务上取得了明显的部分进展。复杂指令遵循和领域专业知识不足是主要失败原因。研究表明,许多经过市场验证的工作流程,目前仍超出通用AI智能体可靠执行的能力范围。
行业资讯 应用 AI模型 研究 2026-08-19 10:32:21 724 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。