Mid-Harness:在模型与执行框架之间扩展终端代理的动作
这项研究探讨在模型与执行框架之间分配额外推理计算,能否提高终端代理执行动作的可靠性。Mid-Harness会采样多个候选动作并进行验证,然后执行其中一个,同时保持生成器和执行框架不变。在TerminalBench-Lite上,使用GPT-5.6-Sol验证器并采样8个动作后,TMAX-9B的Pass@1从50.00%提升至68.03%。当验证能力较弱时,增加采样数量带来的收益很小。研究表明,与生成更多完整轨迹相比,扩展单个动作可能以更低的估算令牌成本实现更高的成功率。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。