The Tasteful Agent:衡量和提升长程任务中的决策能力
一项新研究考察了大型语言模型代理在工程和科研等长程任务中,能否在关键决策分岔点选择正确方向。研究人员推出了 Taste-Bench,从代理执行轨迹中的决策分岔自动构建测试题。表现最好的受测模型也仅答对了 59.7% 的问题。当决定性证据要到轨迹后期才出现时,相关分岔明显更难;增加推理预算也没有提升准确率。不过,研究表明这种能力可以训练:通过蒸馏一个了解最终结果的教师模型的判断,学生模型在未见任务上做出了更好的决策,并提升了保留测试集上 SWE-bench Pro 任务的端到端成功率。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。