原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.17310
立即前往原文

Agentic ESOpt:以最低 GPU 需求微调长程 LLM 智能体

论文提出 Agentic ESOpt,使用进化策略(ES)替代传统强化学习,微调需要长期交互的 LLM 智能体。ES 可以在接近推理阶段的 GPU 显存占用下优化模型全部参数,从而避免沉重的反向传播训练流程,以及长轨迹中的奖励归因难题。该方法在当前模型参数附近采样扰动,评估生成智能体的奖励,并执行在线奖励加权更新;同时通过参数与上下文的协同演化提升适应能力。为平衡探索与适应,方法还采用扰动尺度的余弦衰减计划。在 WebArena-Lite 上,Qwen-3.5-27B 的全参数优化较 No Skill 基线提升 6.69%。在测试时自动启发式设计中,提示词与参数的协同演化在 36 个设置中的 28 个超过了对应基线。
行业资讯 AI模型 研究 2026-08-19 10:02:05 193 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。