原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.17393
立即前往原文

LEGO-RL:面向编程代理的原生 Harness 强化学习

LEGO-RL 是一个将编程代理原生 Harness 接入可扩展策略梯度训练的框架,同时无需修改其内部控制流程。该框架通过进程内 LLM 代理、可扩展的沙箱编排和集成监控,解决环境崩溃与奖励投机导致的信号失真,以及训练与推理之间的不一致。研究人员使用 GSPO 训练 Qwen3.5-35B-A3B,并在三种 Harness 上进行评估。在 SWE-bench Verified 上,OpenHands SDK 的成绩从 64.0% 提升至 70.4%,Claude Code 从 62.4% 提升至 68.2%,OpenCode 从 57.2% 提升至 66.6%。Rollout 与训练概率之间的相关性保持在 0.99 以上。
行业资讯 应用 研究 2026-08-20 01:00:55 906 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。