原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.05303
立即前往原文

ASCENT:通过自蒸馏已验证经验,在推理时在线训练长程智能体

该研究提出 ASCENT,使基于大语言模型的智能体在部署期间从已验证的任务轨迹中学习。该方法不直接模仿智能体生成的 token,而是使用模型初始状态的冻结副本,沿已验证轨迹进行事后预测,再将预测蒸馏到可持续保留的 LoRA 适配器中,以提升后续任务表现。在 ALFWorld、WebShop 和 AppWorld 上的评估显示,随着经验积累,任务成功率和交互效率均有所提高,且能力能够迁移到未见过的场景。
行业资讯 AI模型 研究 2026-10-06 11:01:14 875 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。