RynnValue:利用时间距离扩展机器人价值基础模型
RynnValue 是一个面向机器人操作的开源价值基础模型。它不依赖偏好或进度标注,而是使用时间距离,即从观测结果到语言指定目标的有向代价。这使模型能够利用超过 7,000 小时数据和约 300 万个指令条件视频片段进行训练。在 RBM-EVAL-OOD 基准测试中,RynnValue 的 Kendall tau_a 达到 0.675,超过完全使用偏好监督的方法(0.655)。将其转换为密集奖励后,真实世界策略的成功率在线上测试中从 52.5% 提升至 72.5%,离线测试中从 63.8% 提升至 82.5%,并能零样本泛化到未见过的任务、机器人形态和视角。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。