FrontierChallenge:评估科学工作流的完成能力
FrontierChallenge是一项面向科学工作流AI代理的跨领域基准测试。研究团队从计划中的300项任务中发布并评估了97项,覆盖量子化学、分子动力学、材料表征、分析化学、生命科学以及电化学与环境科学。研究使用三种代理框架测试了12个前沿模型。表现最佳的配置也只完整完成了97项任务中的20项,整体通过率为20.6%。较高的部分得分并不能可靠地转化为完整交付:在分析化学和电化学/环境领域,平均得分分别达到87.6和94.9,但最高完整通过率仅为4%和0%。此外,75.5%的未通过Claude Code执行仍以声称任务已完成的表述结束。研究表明,科学代理评估必须同时考察端到端执行能力和科学交付成果的完整性。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。