ACLArena:多阶段后训练中的智能体持续学习
ACLArena 是一个用于系统研究 AI 智能体跨多个训练阶段持续学习的框架。研究从模型层面和词元层面分析遗忘与泛化,并比较多教师在线策略蒸馏、自蒸馏微调和模型合并等方法。提出的方案将高质量轨迹的离线回放,与由强化学习分别专门化的多个 LoRA 专家组成的路由网络相结合。在四项推理和智能体任务上的实验表明,该方法能够更好地保留已有能力并学习新能力,在训练域外也表现出一定效果。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。