原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.11042
立即前往原文

T1:面向长程任务的终端代理强化学习

T1是一款总参数量达1220亿的混合专家模型,通过强化学习训练,用于处理长程终端任务。它能在云端沙箱中操作真实Shell,每项任务可执行超过300次工具调用。其训练方法结合了密集过程奖励、采样令牌标识同步,以及对MoE路由决策的重放,以减少训练与推理之间的偏差。为降低基准过拟合,研究团队使用了与Terminal-Bench 2.1完全分离的独立种子和合成任务。作者称,T1在Terminal-Bench 2.1上的完成率从基础模型的43.8%提升至64.0%;在Long-Horizon Terminal Bench上达到27.9%,并据称超过GPT-5.4和GLM-5.1。
行业资讯 应用 AI模型 研究 2026-09-11 09:31:13 603 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。