原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.10528
立即前往原文

Long-WAM:扩展世界-动作模型的上下文

Long-WAM 是一套模型与系统框架,旨在实时机器人控制中利用更长的视觉历史。研究发现,当视频模型采用自回归方式预训练时,延长上下文带来的收益更大。在 RoboCasa GR-1 上,将上下文扩展至 19.2 秒后,成功率从 63.3% 提升至 78.7%;双向预训练未带来类似提升。Long-WAM 在 LIBERO-Long、RoboTwin 2.0 和 DOMINO 的对比方法中也取得最佳结果。流式编码和异步执行使其能够部署在多种 NVIDIA 平台及机器人上;在动态叠杯任务中,成功率达到 95%。
行业资讯 应用 AI模型 研究 2026-10-08 11:01:02 507 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。