原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.23989
立即前往原文

ACLArena:多阶段后训练中的智能体持续学习

ACLArena 是一个用于系统研究 AI 智能体跨多个训练阶段持续学习的框架。研究从模型层面和词元层面分析遗忘与泛化,并比较多教师在线策略蒸馏、自蒸馏微调和模型合并等方法。提出的方案将高质量轨迹的离线回放,与由强化学习分别专门化的多个 LoRA 专家组成的路由网络相结合。在四项推理和智能体任务上的实验表明,该方法能够更好地保留已有能力并学习新能力,在训练域外也表现出一定效果。
行业资讯 AI模型 研究 2026-09-23 04:01:04 966 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。