Long-WAM:扩展世界-动作模型的上下文
Long-WAM 是一套模型与系统框架,旨在实时机器人控制中利用更长的视觉历史。研究发现,当视频模型采用自回归方式预训练时,延长上下文带来的收益更大。在 RoboCasa GR-1 上,将上下文扩展至 19.2 秒后,成功率从 63.3% 提升至 78.7%;双向预训练未带来类似提升。Long-WAM 在 LIBERO-Long、RoboTwin 2.0 和 DOMINO 的对比方法中也取得最佳结果。流式编码和异步执行使其能够部署在多种 NVIDIA 平台及机器人上;在动态叠杯任务中,成功率达到 95%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。