原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.33391
立即前往原文

超越时间戳:面向长时程智能体的决策对齐式 On-Policy 蒸馏

论文提出 AlignOPSD,这是一种面向长序列决策智能体的 On-Policy 自蒸馏方法。研究指出,基于时间戳的监督信号可能与学生模型的对应决策不匹配,而一次决策也可能跨越多个时间步。AlignOPSD 将监督信号对齐到功能相符的决策情境,并在持续时间不同的决策区间内分配信用。使用 Qwen2.5-3B 和 Qwen2.5-7B 在 ALFWorld、WebShop 和 Search-QA 上进行的评估显示,该方法优于 GRPO 和 StepOPSD;相较 GRPO,提升幅度为 5.5% 至 8.7%。
行业资讯 研究 2026-09-29 11:01:13 778 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。