原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.38288
立即前往原文

AREX-2通过长程反思任务推进自我改进智能体

AREX-2研究大型语言模型智能体在测试时迭代改进解决方案的能力。该方法结合了两项能力:反思,即生成优于当前方案的新解;以及长程执行,使改进过程能够持续多个回合。研究人员从机器学习和算法编程任务中合成长程改进轨迹,因为这些领域能够提供可验证的反馈和奖励。基于Qwen3.8-27B构建的智能体在MLE-bench Lite上获得81.8分,在Frontier-CS上获得70.7分,并在多项深度研究基准测试中表现出迁移能力。结果还显示,随着可用回合数增加,智能体仍能持续改进。
行业资讯 应用 AI模型 研究 2026-10-01 14:01:15 488 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。