ASCENT:通过自蒸馏已验证经验,在推理时在线训练长程智能体
该研究提出 ASCENT,使基于大语言模型的智能体在部署期间从已验证的任务轨迹中学习。该方法不直接模仿智能体生成的 token,而是使用模型初始状态的冻结副本,沿已验证轨迹进行事后预测,再将预测蒸馏到可持续保留的 LoRA 适配器中,以提升后续任务表现。在 ALFWorld、WebShop 和 AppWorld 上的评估显示,随着经验积累,任务成功率和交互效率均有所提高,且能力能够迁移到未见过的场景。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。