原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.33848
立即前往原文

QwenGyre:用于训练超长时域智能体的弹性强化学习框架

QwenGyre是一套面向在线强化学习的框架,适用于执行时间长达数小时、包含数百次模型与环境交互,并在每次rollout中生成数十万令牌的智能体任务。该框架可在rollout与训练之间动态调配GPU,重建分支轨迹,评估阶段性进展,并去除冗余路径。根据文中评测,QwenGyre将NL2RepoBench成绩从52.5%提升至58.5%,相较Colocate最高加速1.85倍,相较Async最高加速1.78倍。
行业资讯 AI模型 研究 2026-09-29 15:01:09 346 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。