ClawGym II 探索面向智能体框架的黑盒强化学习
ClawGym II 提出了一套框架,用于通过复杂且不透明的智能体框架,对通用 AI 智能体进行稳定、可扩展的强化学习优化。该系统利用沙盒隔离任务环境并支持并行执行,通过服务代理捕获模型调用,再以前缀树重建多轮轨迹,同时适配 PPO 和 GRPO。使用 Qwen3-30A3B 时,ClawGym-Bench 的 Pass@1 在 OpenClaw 和 Claude Code 上分别提升 9.98 和 14.81 个百分点,并在 JobBench 和 OfficeQA 上取得持续改进。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。