Memento 3:通过反思式规则手册实现基于模型的递归自我改进
Memento 3让固定不变的LLM智能体借助外部持久化、可随证据修订的规则手册,学习明确的世界模型。智能体将规则编译为可执行代码,并依据预测误差进行改进;只有当代码忠实遵循规则手册且能精确重现观测到的状态转移时,更新才会被采纳。在ARC-AGI-3中,单模型智能体通过了25款公开游戏的所有关卡,平均RHAE达到100,使用的动作数量为人类的44%。在三场Pong测试中,学到的反馈控制器每场均以21比0获胜,且无需再次调用LLM。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。