漂移约束优化:指令模型微调的关键在于更新方向
一项研究将微调重新定义为:在预先设定的行为漂移预算内选择有效的更新方向。研究人员在 Qwen3-8B 和 Qwen3-14B 上进行测试,发现粗粒度的层选择方法可以克服仅使用最终答案进行微调的局限。所得模型在保持推理能力和通用能力的同时,提升了 100 多种语言的科学推理与多语言翻译表现。代码和模型资源已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。