SimWAM:面向端到端自动驾驶的简易世界动作模型
SimWAM是一种面向自动驾驶的世界动作模型,仅在训练阶段使用视频生成。该方法联合训练预训练视频专家模型和轻量级动作专家模型,并通过注意力掩码使轨迹预测不依赖未来视频帧。训练完成后可以移除视频分支,从而得到低延迟的独立规划器。研究人员还使用强化学习优化驾驶奖励,使其超越单纯的轨迹模仿。据论文介绍,SimWAM在NAVSIM上达到91.5 PDMS,超过现有基于世界动作模型的规划器,并可零样本迁移至nuScenes。代码和模型权重已经公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。