MemBodied:面向视觉-语言-动作模型的循环关联记忆
视觉-语言-动作模型为通用机器人控制提供了有力基础,但大多数策略不会保留先前观测中的信息。MemBodied提出固定容量的情景记忆,由记录交互的关联状态和代表初始场景的紧凑参照组成。在五项需要记忆的RMBench任务中,其平均成功率是无记忆策略的7.81倍、基础循环记忆的2.98倍。与最强的记忆增强基线相比,表现高出1.3倍,新增参数量则少了10倍。在LIBERO-Long上,MemBodied达到90.6%,据报告比无记忆的π_0策略提升5.4%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。