将潜在动作作为意图,实现世界动作模型的高效未来想象
LAWA是一种世界动作模型架构,通过紧凑的潜在动作表示未来意图,而不是在推理时生成未来观测或视频。该方法在保留未来规划优势的同时降低了延迟。在RoboCasa上,LAWA在少样本设置下取得65.6%的平均成功率,在完整数据设置下达到80.8%,分别比匹配的Fast-WAM基线高9.6和4.5个百分点。与匹配的Joint-WAM变体相比,LAWA保持了相当的性能,同时将推理延迟降低42.9%。此外,该模型在LIBERO-Plus零样本测试和真实机器人任务中也展现出有竞争力的表现。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。