SAKI 利用最大耦合分配 On-Policy 蒸馏中的教师监督信号
SAKI 是一种 On-Policy 蒸馏方法,根据最大耦合中的接受和修正事件分配逐 token 的教师监督信号。对于接受的位置,保留对采样 token 的反向 KL 监督;对于修正的位置,则直接监督教师模型概率最高的 token。受 KL 约束的 rollout 同时限制轨迹偏移,以及修正和专门监督的频率。集成在引擎中的推测式验证器,在相同工作负载下将 rollout 吞吐量提升至 4.22 倍。在七项数学推理基准测试中,相较于匹配的教师引导基线,SAKI 提升了 1.7B 和 0.6B 参数学生模型的 Mean@8 与 Pass@8。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。