原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.31100
立即前往原文

S3Gym:大语言模型能否将自我测试和自我评判转化为自我改进?

S3Gym是一项交互式基准测试,用于评估大语言模型能否测试自身行为、判断由此产生的经验,并改进未来的决策。该方法将开放式探索与严格的保留集评估分开,并在七个配备可执行环境验证器的文字游戏中测试智能体。研究比较了三种利用交互经验的路径:直接使用历史记录进行上下文学习、基于得分的摘要记忆,以及参数训练。结果表明,自我改进既不会自动发生,也不具有一致性。当经验能够被压缩为可复用的策略规则时,摘要更有帮助;而当成功依赖精确的状态相关信息时,原始历史记录往往表现更好。参数训练在部分任务上带来显著提升,但在其他任务上也出现改进不稳定和严重负迁移。研究表明,识别成功行动并不足够,智能体还必须将反馈转化为可执行、可迁移的策略。
行业资讯 AI模型 研究 2026-09-03 12:31:01 203 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。