QwenGyre:用于训练超长时域智能体的弹性强化学习框架
QwenGyre是一套面向在线强化学习的框架,适用于执行时间长达数小时、包含数百次模型与环境交互,并在每次rollout中生成数十万令牌的智能体任务。该框架可在rollout与训练之间动态调配GPU,重建分支轨迹,评估阶段性进展,并去除冗余路径。根据文中评测,QwenGyre将NL2RepoBench成绩从52.5%提升至58.5%,相较Colocate最高加速1.85倍,相较Async最高加速1.78倍。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。