原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.13040
立即前往原文

潜在在线策略自蒸馏

该研究提出潜在在线策略自蒸馏(LOPD),旨在帮助 AI 智能体将经验直接融入自身策略。LOPD 不依赖设计者预先制定的特权信息,而是端到端学习这类上下文:系统检索相关经验,并将其组合为连续潜在 token,用于调节自教师模型。学生模型根据任务和交互历史生成轨迹,并在每个访问过的前缀位置获得密集的 token 级监督。研究还引入特权边际目标,以提升训练稳定性。在智能体工具使用和代码生成实验中,LOPD 的表现超过 RLVR,以及 OPSD、SDPO 和 Skill-SD 等代表性在线策略自蒸馏方法。其学习效率也超过 GRPO 和 Skill-SD,同时使用的 rollout 预算不到后者的 30%。不过,这些结果仍属于实验性研究发现,尚不能证明具备广泛的自主自我改进能力。
行业资讯 AI模型 研究 2026-08-17 13:00:55 995 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。