当智能体开始变慢:通过每Token Elo分析理解LLM智能体的测试时策略
这项研究分析了大语言模型智能体如何在推理阶段分配额外算力,包括修改解法、使用工具、探索替代方案以及决定何时停止。研究人员提出每Token Elo分析,跟踪不同Token预算下找到的最佳解,并比较评分尺度不同的任务。在四个智能体和四个开放式基准上的实验表明,智能体起初比独立采样更高效地将Token转化为进展,但边际收益会下降,最终低于该参考水平。相比之下,人类参赛者在类似的优化任务中仍以超线性速度提升,说明智能体仍有较大改进空间。将1亿Token分配到多个并行会话后,在一个基准上的表现比单次长会话最高提升355个Elo分。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。