WorldToken:面向机器人模仿学习的时间优先序列建模
WorldToken是一种机器人策略架构,在每个决策步骤中将多视角图像、本体感知和任务条件融合为一个世界令牌。因果时间Transformer处理由此形成的令牌序列,扩散动作头则生成动作片段。在RoboCasa的23项任务上,一个拥有8530万参数、除冻结的预训练CLIP文本编码器外均从头训练的模型,使用每项任务2900条生成示范,取得了59.45%的平均闭环成功率。针对数据集规模、模型规模和训练随机种子的全面实验显示,增加目标领域数据能够持续带来收益,但模型规模超过中等水平后收益递减。缩短可见历史会降低所有测试策略的性能。研究证明了完整WorldToken实现的可行性,但没有证明其优于其他序列组织方式,也未确定具体哪些组件带来了性能提升。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。