ControlScope:LLM 智能体的工作流修订与可靠性
ControlScope 研究语言模型智能体应在多大程度上修订正在执行的工作流:继续运行生成的代码、编辑下一次工具调用的数据参数,或替换尚未完成的工作流。研究区分了允许进行的修复与智能体实际选择的操作,并在文件系统任务、ALFWorld 和 AppWorld 上评估单次及重复审查。在 20 项文件系统任务中,部分测试里 FULL 完成了 15 至 16 项,高于 KEEP 的 13 项;其他测试中,FULL 完成 10 至 13 项,低于 KEEP 的 13 项。ALFWorld 和 AppWorld 的差异总体较小。研究还发现,后续修订可能破坏可行的修复方案,而更广泛的修订策略可能忽略成本更低且能够成功的编辑。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。