超越时间戳:面向长时程智能体的决策对齐式 On-Policy 蒸馏
论文提出 AlignOPSD,这是一种面向长序列决策智能体的 On-Policy 自蒸馏方法。研究指出,基于时间戳的监督信号可能与学生模型的对应决策不匹配,而一次决策也可能跨越多个时间步。AlignOPSD 将监督信号对齐到功能相符的决策情境,并在持续时间不同的决策区间内分配信用。使用 Qwen2.5-3B 和 Qwen2.5-7B 在 ALFWorld、WebShop 和 Search-QA 上进行的评估显示,该方法优于 GRPO 和 StepOPSD;相较 GRPO,提升幅度为 5.5% 至 8.7%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。