原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.11794
立即前往原文

Memento 3:通过反思式规则手册实现基于模型的递归自我改进

Memento 3让固定不变的LLM智能体借助外部持久化、可随证据修订的规则手册,学习明确的世界模型。智能体将规则编译为可执行代码,并依据预测误差进行改进;只有当代码忠实遵循规则手册且能精确重现观测到的状态转移时,更新才会被采纳。在ARC-AGI-3中,单模型智能体通过了25款公开游戏的所有关卡,平均RHAE达到100,使用的动作数量为人类的44%。在三场Pong测试中,学到的反馈控制器每场均以21比0获胜,且无需再次调用LLM。
行业资讯 AI模型 研究 2026-10-10 07:01:07 921 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。