原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.31111
立即前往原文

ASPIRE:模型能否从模糊目标中自我进化?

ASPIRE是一项用于评估人工智能系统能否根据模糊目标自我改进的基准测试,例如“成为更好的研究者”。系统不会获得明确的任务和评估指标,只会收到一项自然语言能力目标。随后,智能体必须自行选择数据和更新方法,构建训练与验证信号,并决定评估时机。ASPIRE同时支持模型权重更新和智能体框架演化,并通过覆盖六个目标的520道专家编写隐藏题目进行评估。实验显示,当前智能体通常能够完成训练和框架编辑循环,但权重层面的提升稀少且不稳定。表现最好的演化框架仍低于经过工程优化的Qwen-Agent参考系统。智能体经常使用不匹配的数据,并过度依赖范围狭窄的自我评估,导致局部提升无法迁移到隐藏测试中。
行业资讯 AI模型 研究 2026-09-03 12:31:01 321 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。