原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.39820
立即前往原文

从运行时反馈中学习:通过失败库自我进化的视觉-语言-动作模型

FailBank 是一个由四个阶段组成的框架,利用运行时反馈持续改进视觉-语言-动作(VLA)模型。基于控制障碍函数的固定安全模块提出修正建议,同时仍由策略控制动作。有用的建议会转化为修正目标;未经修正且成功的动作则保留为受控 LoRA 更新的参照。在 VLA-Arena 基准测试中,使用两个难度级别和两种基础模型,与基础策略相比,FailBank 将任务成功率分别提高 8.5 和 6.9 个百分点,并将策略导致的累计成本分别降低 35.6% 和 23.8%。与运行时屏蔽机制相比,其成功率分别提高 25.4 和 9.5 个百分点,同时成本保持在相近水平。
行业资讯 应用 AI模型 研究 2026-10-05 23:31:00 491 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。