StateM通过执行框架扩展,在Terminal-Bench 2.1上达到95.3%准确率
StateM是一套面向AI代理的运行时系统,通过持久状态、阶段化上下文、经过检查的状态转换、可恢复运行手册和版本化程序规则,改进长时任务执行,同时不修改模型权重。研究团队称,在Terminal-Bench 2.1上,StateM使GPT-5.6 Sol xhigh在445次试验中达到95.3%的原始准确率,并让89项任务全部至少成功一次。GPT-5.5、GPT-5.6 Luna和DeepSeek-V4 Flash也获得性能提升,API支出则明显低于参考GPT运行。在BusinessBench上,增益相对有限,并取决于任务是否具有相似的执行结构。代码已在GitHub公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。