StartupBench:基于市场验证的端到端工作流评测通用智能体
StartupBench是一项评估AI智能体执行完整真实工作流程能力的基准测试。它不主要依赖研究人员挑选的任务,而是以已证明拥有用户采用率和实际需求的AI产品为基础,覆盖多个专业领域。研究人员将这些工作流转化为面向交付成果的任务,并通过细致的评分标准进行评估。即使是测试中表现最强的模型,也只能完整完成约30%的任务,尽管在许多任务上取得了明显的部分进展。复杂指令遵循和领域专业知识不足是主要失败原因。研究表明,许多经过市场验证的工作流程,目前仍超出通用AI智能体可靠执行的能力范围。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。