原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.07753
立即前往原文

从证据到行动:使用工具的智能体如何失败

使用工具的智能体可能对外部系统造成重大影响,但结果正确并不意味着其行动得到了事先确立的证据支持。本研究考察从决定是否行动,到执行单项操作和存在依赖关系的工作流这一过程中,证据与行动之间的链条会在哪里断裂。在十种模型与测试框架配置中,静态行动评估能力较强,有时却伴随着明显较弱的交互式执行能力。失败往往在执行前就已开始:智能体调查不充分便停止,或在必要证据确立之前采取行动。取得证据后,单项操作通常能够可靠执行;多步骤工作流还会暴露尚未解决的前置条件和执行不完整问题。研究推出SafeActBench,包含来自六个运营领域、五种测试协议的656个案例。与证据来源绑定的证据账本和确定性评估器用于追踪已确立的信息、行动发生的时间,以及后续依赖条件是否得到满足。
行业资讯 伦理与安全 研究 2026-10-07 14:01:08 225 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。