PerturBot:通过扰动训练打破视觉-语言-动作模型的捷径先验
视觉-语言-动作(VLA)策略可能依赖训练数据中的捷径完成任务,而没有充分利用决策所需的证据。这些捷径可能来自视觉线索、熟悉的词语或动作模式。PerturBot旨在降低这种依赖:在保持任务不变的前提下扰动腕部摄像头视角,在指令中加入与决策相关的描述,并纳入随机及失败的轨迹片段,再根据其中实际包含的行为重新标注。研究还提出GroundingFscore,用于离线诊断策略对模态捷径的依赖程度。该框架改进训练与评估方式,但不改变推理过程。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。