Agentic ESOpt:以最低 GPU 需求微调长程 LLM 智能体
论文提出 Agentic ESOpt,使用进化策略(ES)替代传统强化学习,微调需要长期交互的 LLM 智能体。ES 可以在接近推理阶段的 GPU 显存占用下优化模型全部参数,从而避免沉重的反向传播训练流程,以及长轨迹中的奖励归因难题。该方法在当前模型参数附近采样扰动,评估生成智能体的奖励,并执行在线奖励加权更新;同时通过参数与上下文的协同演化提升适应能力。为平衡探索与适应,方法还采用扰动尺度的余弦衰减计划。在 WebArena-Lite 上,Qwen-3.5-27B 的全参数优化较 No Skill 基线提升 6.69%。在测试时自动启发式设计中,提示词与参数的协同演化在 36 个设置中的 28 个超过了对应基线。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。