EmbodiedMemory-Bench 评测长期具身任务中的记忆能力
长期与环境交互的智能体需要保留并持续更新通过观察和行动获得的信息。EmbodiedMemory-Bench(EMem-Bench)旨在评估这类能力,包含四类任务、共 2,554 个交互回合,要求智能体从过往交互中建立记忆,并在后续任务中加以利用。研究团队还推出外部记忆系统 EMem,用于整理空间、事件和场景记忆;以及能够管理和使用这些记忆的 80 亿参数策略模型 EMem-8B。评测结果显示,现有模型在四项挑战中的表现仍然较弱且不均衡。在基座模型相同的对比中,EMem 在受测记忆系统中取得最佳整体表现,并提升了开源模型和专有模型的成绩。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。