Dream4ACT:面向多种机器人构型的共享视觉动作接口
Dream4ACT 是一种面向不同机器人构型、联合建模视频与动作的世界模型。其共享视觉动作接口从四个虚拟摄像机视角渲染目标关节配置,使观测序列与动作序列能够共用视频自编码器和扩散 Transformer。该模型支持正向动力学、逆向动力学,以及观测与动作的联合生成。为将预测的动作视图还原为可执行动作,研究提出了一种受 URDF 约束、无需训练的多视角恢复方法,无须为每种机器人单独训练解码器。Dream4ACT 在 RoboTwin 2.0 上的平均成功率为 88.98%,在 TriWorldBench 上的总分为 65.66。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。