Second Thought:LLM智能体行动与观察期间的并行推理
采用ReAct范式的LLM智能体会在推理、行动和观察之间交替进行,但在等待环境响应时,推理会暂停。Second Thought利用这段空闲时间,在每次Thought阶段结束后立即并行启动四个辅助推理分支,并在下一次环境观察到达时合并结果。在三个智能体基准和三个推理模型上,该方法在全部九个模型与基准组合中都降低了平均交互轮数。在其中六个组合中,主线程的顺序解码量最多减少43%,第七个组合基本不变。Pass@1在九个组合中的七个没有显著变化,另外两个分别提升12.4和10.2个百分点。与计算量匹配的对照方法相比,在适用的四个条件中,该方法均取得更高的Pass@1,并减少了1.3至3.2个顺序解码步骤。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。