从运行时反馈中学习:通过失败库自我进化的视觉-语言-动作模型
FailBank 是一个由四个阶段组成的框架,利用运行时反馈持续改进视觉-语言-动作(VLA)模型。基于控制障碍函数的固定安全模块提出修正建议,同时仍由策略控制动作。有用的建议会转化为修正目标;未经修正且成功的动作则保留为受控 LoRA 更新的参照。在 VLA-Arena 基准测试中,使用两个难度级别和两种基础模型,与基础策略相比,FailBank 将任务成功率分别提高 8.5 和 6.9 个百分点,并将策略导致的累计成本分别降低 35.6% 和 23.8%。与运行时屏蔽机制相比,其成功率分别提高 25.4 和 9.5 个百分点,同时成本保持在相近水平。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。