Agent-G^2:面向智能体强化学习的高斯引导
Agent-G^2是一种用于解决长时程智能体任务中稀疏奖励问题的强化学习方法。它不再采用固定的引导深度,而是从高斯分布中按任务采样需要保留的专家轨迹前缀长度。分布的中心和离散程度根据策略优化过程中已经收集的轨迹在线估计,因此无需额外的探测轨迹或单独的深度预测器。在使用Qwen2.5-1.5B和7B-Instruct进行的ALFWorld及WebShop评估中,该方法在ALFWorld上最高提升7.4个百分点,同时轨迹采样成本不到逐样本探测方法的三分之一。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。