RoMeRL 平衡自进化智能体的反馈覆盖与记忆奖励陷阱
RoMeRL 是一种用于管理自进化大语言模型智能体记忆的方法。它用按结果极性和记忆动态组织的固定维度任务记忆状态,取代不断扩大的轨迹索引效用空间。这样可以将反馈集中到有限的效用坐标上,并减少共同检索的无关记忆获得错误奖励更新的问题。在 ALFWorld 和 LifelongAgentBench 上的实验中,RoMeRL 提升了任务表现,使 Cold-Q 比率降低 80.0%,反馈密度提高约 6 倍,维护的记忆规模减少 84.4%,LLM 调用次数减少 21.1%。代码已在 GitHub 开源。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。