ClawProBench:通过执行轨迹、运行时覆盖率和冻结式工作场景测试评估 AI 智能体
ClawProBench 是一个通过执行轨迹而非仅凭最终答案评估 AI 智能体的基准测试。该项目基于 OpenClaw 运行时,覆盖浏览、记忆、消息、调度、技能和子智能体等工作区工具及原生功能。测试包括 102 个场景的完整配置,以及采用封闭式 JSON 输出契约的 68 个场景冻结留出集。其安全门控评分结合正确性、流程质量和效率,并保留失败证据以供审计。原生运行时任务的表现低于实时工作区任务,完整测试与留出集之间的排名一致性也较弱。结果表明,只看最终答案的排行榜可能掩盖原生接口缺陷、偶然成功和局部执行失败。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。