原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.11699
立即前往原文

负向自蒸馏:通过规避缺陷学习推理

研究人员提出了“负向自蒸馏”(NSD),用于提升大语言模型在复杂推理任务中的表现。该方法针对策略内自蒸馏(OPSD)的一项缺陷:模型可能模仿利用特权信息生成的、过度自信的推理轨迹,从而抑制不确定性表达、探索和自我纠错。NSD不要求模型模仿正确答案,而是让模型偏离由自身生成的、针对具体问题的负向条件,例如“粗心推理者”的行为。研究人员还设计了动态门控机制,自动识别推理关键词元,使梯度更新只针对行为缺陷,同时保留模型的基础语言能力。实验结果显示,NSD持续优于OPSD以及其他无标签、自举式强化学习基线方法。
行业资讯 AI模型 研究 2026-09-12 13:30:55 992 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。