原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.05622
立即前往原文

UndoBench 将使用工具的 AI 智能体的任务能力与恢复能力分开评估

UndoBench 是一项基准测试,分别衡量 AI 智能体在正常情况下完成任务的能力,以及从故障中恢复的能力。测试涵盖 8 个企业领域中的 36 个工作流和 36 种故障场景。在 2,880 组配对试验中,常规任务能力为 83.54%,条件恢复成功率则为 46.72%。简单重试在 53.33% 的试验中造成外部效果重复。研究显示,恢复风险会随执行阶段而变化;如果只评估任务是否完成,这些风险可能被掩盖。
行业资讯 应用 研究 2026-10-06 18:31:08 649 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。