原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.40285
立即前往原文

PivotOPD让多轮智能体学会从关键错误中恢复

PivotOPD是一种用于训练语言智能体的在策略蒸馏方法,旨在帮助模型避免关键错误,并从错误造成的状态中恢复。在三个Qwen3模型上的实验显示,超过一半的失败轨迹包含一个发生较早的行动,该行动会使智能体偏离任务目标。研究人员发现,许多此类失败只需在关键错误后的几轮中提供引导即可恢复。在ALFWorld、WebShop和基于搜索的问答测试中,PivotOPD在Qwen3-1.7B和Qwen3-8B上都取得了最高的平均性能。与最强基线相比,1.7B模型在ALFWorld上提升了5.5个百分点。在软件工程领域,该方法还将Nemotron-3.5在SWE-Bench Verified上的解决率提高了3.2个百分点。
行业资讯 应用 AI模型 研究 2026-10-02 07:01:12 756 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。