Grounded Action Model:以三维定位为机器人基础
研究人员提出 Grounded Action Models(GAM),一种将物体三维定位明确融入机器人基础模型的方法。语言、点和框提示会被转换为统一的以物体为中心的表示,其中包含面向目标的视觉特征和可度量的物体几何信息,再由多流 Transformer 与机器人状态历史结合,预测动作片段。GAM 在 RoboTwin 2.0 的 50 项任务中取得 55.3% 的平均成功率,在 LIBERO-PRO 上达到 61%,在该评测中处于领先水平。在视觉条件发生变化的双臂机器人测试中,GAM 20 次成功 17 次,而 π₀.₅ 仅成功 4 次。结果表明,该方法在目标位置变化、场景扰动和长时程操作任务中具有更强的鲁棒性。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。