原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.13680
立即前往原文

漂移约束优化:指令模型微调的关键在于更新方向

一项研究将微调重新定义为:在预先设定的行为漂移预算内选择有效的更新方向。研究人员在 Qwen3-8B 和 Qwen3-14B 上进行测试,发现粗粒度的层选择方法可以克服仅使用最终答案进行微调的局限。所得模型在保持推理能力和通用能力的同时,提升了 100 多种语言的科学推理与多语言翻译表现。代码和模型资源已公开。
行业资讯 AI模型 研究 开源 2026-09-16 11:31:02 140 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。