AREX-2通过长程反思任务推进自我改进智能体
AREX-2研究大型语言模型智能体在测试时迭代改进解决方案的能力。该方法结合了两项能力:反思,即生成优于当前方案的新解;以及长程执行,使改进过程能够持续多个回合。研究人员从机器学习和算法编程任务中合成长程改进轨迹,因为这些领域能够提供可验证的反馈和奖励。基于Qwen3.8-27B构建的智能体在MLE-bench Lite上获得81.8分,在Frontier-CS上获得70.7分,并在多项深度研究基准测试中表现出迁移能力。结果还显示,随着可用回合数增加,智能体仍能持续改进。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。