StreamPI:面向视觉-语言-动作模型的流式多模态时序建模
StreamPI在不增加额外参数的情况下,为基于单帧的视觉-语言-动作模型加入时序推理能力,用于机器人操作。该方法将每组视觉观测和语言指令视为一个时序单元,在单元内部使用双向注意力进行跨模态融合,在单元之间使用因果注意力支持流式推理。通过采用随机帧间隔训练,系统旨在缩小同步训练与真实机器人异步部署之间的差距。StreamPI可以继承预训练单帧模型的权重,并支持单帧和多帧推理。在真实机器人任务和LIBERO仿真基准测试中,StreamPI在多项涉及记忆能力和精确空间感知的任务上优于pi0.5。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。