原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.27351
立即前往原文

进化策略在大语言模型推理覆盖度上优于GRPO

该研究分析了进化策略(ES)作为一种面向大语言模型推理能力的内存高效后训练方法。与群组相对策略优化(GRPO)相比,ES能够保持更高的候选解多样性,并在Pass@K指标上取得更好表现。GRPO容易出现熵坍缩,而ES在提升Pass@1的同时,可以覆盖更多推理路径。研究提出的序列式GRPO-ES训练策略,结合了GRPO获取最佳答案的优势与ES更广泛的覆盖能力。研究还发现,尽管模型整体参数可能发生较大漂移,性能提升主要来自少量幅度较大的关键更新;参数变化广泛也不一定会导致灾难性遗忘。研究由此将ES定位为独立的推理后训练范式,而不仅是GRPO的低内存替代方案。
行业资讯 AI模型 研究 2026-08-28 10:30:52 703 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。