原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.04616
立即前往原文

PerturBot:通过扰动训练打破视觉-语言-动作模型的捷径先验

视觉-语言-动作(VLA)策略可能依赖训练数据中的捷径完成任务,而没有充分利用决策所需的证据。这些捷径可能来自视觉线索、熟悉的词语或动作模式。PerturBot旨在降低这种依赖:在保持任务不变的前提下扰动腕部摄像头视角,在指令中加入与决策相关的描述,并纳入随机及失败的轨迹片段,再根据其中实际包含的行为重新标注。研究还提出GroundingFscore,用于离线诊断策略对模态捷径的依赖程度。该框架改进训练与评估方式,但不改变推理过程。
行业资讯 AI模型 研究 2026-10-06 15:01:07 642 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。