原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.39982
立即前往原文

Mid-Harness:在模型与执行框架之间扩展终端代理的动作

这项研究探讨在模型与执行框架之间分配额外推理计算,能否提高终端代理执行动作的可靠性。Mid-Harness会采样多个候选动作并进行验证,然后执行其中一个,同时保持生成器和执行框架不变。在TerminalBench-Lite上,使用GPT-5.6-Sol验证器并采样8个动作后,TMAX-9B的Pass@1从50.00%提升至68.03%。当验证能力较弱时,增加采样数量带来的收益很小。研究表明,与生成更多完整轨迹相比,扩展单个动作可能以更低的估算令牌成本实现更高的成功率。
行业资讯 应用 AI模型 研究 2026-10-01 14:30:53 736 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。