原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.03665
立即前往原文

Pivot-SD:面向掩码扩散语言模型的高效自蒸馏

掩码扩散语言模型为自回归模型提供了一种并行处理方案,但训练中存在一个独特难题:去噪过程中的少数决策可能显著影响最终回答。Pivot-SD是一种离线自蒸馏方法,依据信息增益挑选这些影响较大的决策(称为“枢轴”)。它使用交叉熵训练成功轨迹中的枢轴,并对失败轨迹中的枢轴进行有针对性的非似然训练。仅使用200个问题、每题生成四次,Pivot-SD就在数学和代码基准测试中提升了LLaDA-8B-Instruct的表现,优于全序列SFT和计算预算相当的扩散强化学习基线。
行业资讯 AI模型 研究 2026-10-05 15:31:58 112 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。