Dynin-Robotics:统一视觉、语言与机器人动作的全模态扩散模型
Dynin-Robotics是一种全模态扩散模型,将语言、视觉观测、目标和动作表示为离散令牌。该模型使用来自48个Open X-Embodiment数据集的约133万条轨迹进行持续预训练,支持动作预测、动作条件下的下一观测预测、终端目标状态预测,以及从轨迹重建指令。共享轨迹建模提升了模型对下游机器人任务的适应能力,也改善了指令变化时的表现。模型在LIBERO和零样本LIBERO-Plus上取得具有竞争力的结果,并在Franka Research 3机器人四种操作条件下达到78.4%的平均成功率。优化后的块并行实现根据报告的测试设置,可将模型端动作解码速度提高最多29.2倍。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。