T1:面向长程任务的终端代理强化学习
T1是一款总参数量达1220亿的混合专家模型,通过强化学习训练,用于处理长程终端任务。它能在云端沙箱中操作真实Shell,每项任务可执行超过300次工具调用。其训练方法结合了密集过程奖励、采样令牌标识同步,以及对MoE路由决策的重放,以减少训练与推理之间的偏差。为降低基准过拟合,研究团队使用了与Terminal-Bench 2.1完全分离的独立种子和合成任务。作者称,T1在Terminal-Bench 2.1上的完成率从基础模型的43.8%提升至64.0%;在Long-Horizon Terminal Bench上达到27.9%,并据称超过GPT-5.4和GLM-5.1。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。