当特权指导与状态不匹配:面向多轮智能体的状态匹配路由与情境化自蒸馏
研究人员提出 SMRC-SD,通过更有选择性的特权蒸馏改进多轮智能体。该方法不再在每个回合无条件使用成功参考轨迹提供的指导,而是先检查智能体当前的执行状态是否得到参考轨迹支持。只有状态匹配时才进行蒸馏,并根据智能体实际到达的状态构建教师上下文。使用 Qwen3-1.7B 时,ALFWorld 的任务成功率从 0.746 提升至 0.865,WebShop 从 0.574 提升至 0.693。消融实验表明,基于状态的路由和与状态兼容的教师上下文都对性能提升有所贡献。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。