AI 智能体如何在自动化科研中失败?基于 100 项真实研究任务的端到端诊断评估
该研究推出 AutoResearchEval,评估来自 7 个科学领域、覆盖从提出想法到同行评审完整科研流程的 100 项真实任务。研究团队使用 8 种模型与智能体框架组合,生成了 800 条科研智能体轨迹,并进行流程级标注。在此基础上,研究者提出 ARFT,归纳出 45 种有实证依据的失败模式。即使是测试中最强的模型,也经常无法核对输出是否与所找到的证据一致,无法修正缺乏支持的结论,也不会质疑所采用路径是否合理。研究认为,根本限制在于缺少元认知循环。相同问题出现在全部 8 种组合中,表明缺陷更可能存在于模型层面,而非某个特定的编排框架。AutoResearchEval 和 ARFT 将公开发布。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。