原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.36601
立即前往原文

SAKI 利用最大耦合分配 On-Policy 蒸馏中的教师监督信号

SAKI 是一种 On-Policy 蒸馏方法,根据最大耦合中的接受和修正事件分配逐 token 的教师监督信号。对于接受的位置,保留对采样 token 的反向 KL 监督;对于修正的位置,则直接监督教师模型概率最高的 token。受 KL 约束的 rollout 同时限制轨迹偏移,以及修正和专门监督的频率。集成在引擎中的推测式验证器,在相同工作负载下将 rollout 吞吐量提升至 4.22 倍。在七项数学推理基准测试中,相较于匹配的教师引导基线,SAKI 提升了 1.7B 和 0.6B 参数学生模型的 Mean@8 与 Pass@8。
行业资讯 AI模型 研究 2026-09-30 10:31:10 673 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。