ZimaBlue通过可扩展视频预训练推进通用世界动作模型
ZimaBlue是一种利用大规模第一视角视频训练机器人世界动作模型的框架。其三阶段训练流程首先从人类和机器人视频中学习因果具身视觉动态,随后通过统一的动作表示将这些表征与异构机器人轨迹结合,最后针对目标机器人进行专门化。异步Slow-Fast架构将高容量Slow世界模型与轻量Fast分支结合,可在NVIDIA RTX 4090上以30 Hz进行动作预测。在真实机器人零样本评估中,相比仅使用目标机器人数据,将训练数据扩展到超过12万小时的具身视频后,成功率从36.1%提升至77.8%。该系统在多个基准测试中也表现出较强性能,尤其在未见过的任务上提升明显。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。