PivotOPD让多轮智能体学会从关键错误中恢复
PivotOPD是一种用于训练语言智能体的在策略蒸馏方法,旨在帮助模型避免关键错误,并从错误造成的状态中恢复。在三个Qwen3模型上的实验显示,超过一半的失败轨迹包含一个发生较早的行动,该行动会使智能体偏离任务目标。研究人员发现,许多此类失败只需在关键错误后的几轮中提供引导即可恢复。在ALFWorld、WebShop和基于搜索的问答测试中,PivotOPD在Qwen3-1.7B和Qwen3-8B上都取得了最高的平均性能。与最强基线相比,1.7B模型在ALFWorld上提升了5.5个百分点。在软件工程领域,该方法还将Nemotron-3.5在SWE-Bench Verified上的解决率提高了3.2个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。