原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.26067
立即前往原文

StreamPI:面向视觉-语言-动作模型的流式多模态时序建模

StreamPI在不增加额外参数的情况下,为基于单帧的视觉-语言-动作模型加入时序推理能力,用于机器人操作。该方法将每组视觉观测和语言指令视为一个时序单元,在单元内部使用双向注意力进行跨模态融合,在单元之间使用因果注意力支持流式推理。通过采用随机帧间隔训练,系统旨在缩小同步训练与真实机器人异步部署之间的差距。StreamPI可以继承预训练单帧模型的权重,并支持单帧和多帧推理。在真实机器人任务和LIBERO仿真基准测试中,StreamPI在多项涉及记忆能力和精确空间感知的任务上优于pi0.5。
行业资讯 应用 AI模型 研究 2026-08-27 12:01:57 320 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。