τ^τ-Bench:面向真实端到端智能体构建的评测环境
τ^τ-Bench是一项评测编码智能体能否在接近真实客户项目的条件下构建完整客服智能体的基准测试。系统会获得企业业务记录、客户需求、生产环境API、现有代码库,以及模型和服务成本限制,随后将构建出的智能体部署到模拟用户环境中进行测试。在覆盖四个领域的53项任务中,使用Claude Code运行Claude Opus 5的最强配置仅通过了23.9%的评测模拟,而专家编写的参考系统达到82.2%。失败主要表现为对业务数据进行浅层查询、与客户沟通不足,以及很少尝试不同的智能体架构和服务成本方案。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。