终端智能体的环境演化
该论文提出“环境演化”方法,用于逐步提高终端智能体训练环境的难度。该方法不再仅依赖在策略 rollout,而是沿三个难度方向以离策略方式演化环境,并在训练过程中按代际安排使用。使用 Hy4 preview、Claude Opus 5 和 GPT-5.6 Sol 的 rollout 实验表明,该方法能够持续生成更具挑战性的环境。在简单的长时程强化学习测试中,Qwen3.6-27B 和 Qwen3.6-35B-A3B 在 Terminal-Bench 2.1 上分别提升了 14.4 和 18.0 个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。