原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.34313
立即前往原文

ControlScope:LLM 智能体的工作流修订与可靠性

ControlScope 研究语言模型智能体应在多大程度上修订正在执行的工作流:继续运行生成的代码、编辑下一次工具调用的数据参数,或替换尚未完成的工作流。研究区分了允许进行的修复与智能体实际选择的操作,并在文件系统任务、ALFWorld 和 AppWorld 上评估单次及重复审查。在 20 项文件系统任务中,部分测试里 FULL 完成了 15 至 16 项,高于 KEEP 的 13 项;其他测试中,FULL 完成 10 至 13 项,低于 KEEP 的 13 项。ALFWorld 和 AppWorld 的差异总体较小。研究还发现,后续修订可能破坏可行的修复方案,而更广泛的修订策略可能忽略成本更低且能够成功的编辑。
行业资讯 AI模型 研究 2026-09-29 11:01:14 456 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。