PonderPounce:将预训练 MLLM 用作机器人控制的情景上下文引擎
PonderPounce 将多模态大语言模型(MLLM)的原生因果上下文用作机器人控制的情景记忆。系统结合了 Ponder 和 Pounce:前者是较慢的 System 2 MLLM,负责积累观测、示范和此前的推理;后者是快速的视觉—语言—动作模型,直接根据当前观测生成动作。两者端到端联合训练,无需专用记忆模块或单独的桥接预训练。经过服务优化后,系统支持 20Hz 的动作执行。在 RoboMME 上,9B 版本达到 60.83%,高于对比方法的 44.51%;使用九倍数据时达到 75.54%。在 RoboCasa-DC 上,系统达到 12.5%,略高于最强公开示范条件基线的 11.6%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。