原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.14905
立即前往原文

AI 智能体如何在自动化科研中失败?基于 100 项真实研究任务的端到端诊断评估

该研究推出 AutoResearchEval,评估来自 7 个科学领域、覆盖从提出想法到同行评审完整科研流程的 100 项真实任务。研究团队使用 8 种模型与智能体框架组合,生成了 800 条科研智能体轨迹,并进行流程级标注。在此基础上,研究者提出 ARFT,归纳出 45 种有实证依据的失败模式。即使是测试中最强的模型,也经常无法核对输出是否与所找到的证据一致,无法修正缺乏支持的结论,也不会质疑所采用路径是否合理。研究认为,根本限制在于缺少元认知循环。相同问题出现在全部 8 种组合中,表明缺陷更可能存在于模型层面,而非某个特定的编排框架。AutoResearchEval 和 ARFT 将公开发布。
行业资讯 研究 开源 2026-08-18 17:00:55 793 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。