超越最终得分:长期人工智能研发代理的系统性评估
一项研究通过36项长期人工智能研发任务,评估了7个前沿模型。该框架不仅考察最终得分,还分析解决方案构思、执行、反馈控制,以及代理在任务内和任务间复用经验的能力。结果表明,当前代理更像工程优化器,而不是完全自主的研究人员。它们能够制定并实施实用方案,但不同运行结果之间的性能差异较大。表现最好的方案通常是对已有技术进行调整或组合,真正的方法论创新仍然少见。研究还发现,流程瓶颈、经验复用方式以及运行环境的设计,都会显著影响代理的性能和稳定性。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。