何时切换:可靠延长视觉-语言-动作模型的动作块
视觉-语言-动作(VLA)模型可统一控制机器人操作,但推理成本较高,机器人可能在每次策略调用之间暂停。延长动作块能够减少中断,但若动作块跨越操作子技能的转换,执行可靠性就会下降。RACE(Reliable Action-Chunk Extension)预测转换时机,并据此引导动作生成。在仿真中,RACE 的表现优于相同动作块长度下的微调方法;动作块长度增加至两倍时,它超过近期对比模型,增加至四倍时仍保持竞争力。在真实机器人上,四倍长的动作块使停走执行造成的空闲时间减少约五倍,成功率也高于相同动作块长度下的微调方法。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。