根因归因是一个搜索问题:持续搜索长程智能体的失败原因
执行长程任务的AI智能体会产生海量运行日志,人工检查故障原因因此难以进行。现有自动根因归因方法通常依赖大语言模型的一次性判断,容易在查看长轨迹中分散的重要证据之前,就过早接受一个看似合理的诊断。研究提出了“Continual Search”迭代框架,促使模型持续寻找尚未解决的诊断证据。该方法在四个现有基准,以及包含50个由人工标注的长程、高执行量任务失败案例的新数据集MegaRCA-Mix上进行了评估。结果显示,该方法在多个模型系列中都能稳定提升归因表现。在MegaRCA-Mix上,GPT-5.5的F1分数从0.349提升至0.498,增幅超过40%。此外,同一模型系列中的低级别模型有时还能超过高级别模型,表明有效搜索可能比单纯扩大模型规模更重要。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。