原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.17744
立即前往原文

用低资源语言思考:SFT构建了什么、RL修复了什么,以及准确率看不到什么

一项研究对阿里巴巴、OpenAI和英伟达的三款混合专家模型进行微调,使其能够用希腊语推理;每个模型有36亿至40亿个活跃参数。准确率基准几乎没有变化,而且在这一规模下噪声很大:仅改变随机种子,得分就会波动7.7分。真正的变化体现在行为层面。基础模型在1000条推理轨迹中没有一条使用希腊语思考,即使问题本身是希腊语。经过监督微调(SFT)后,模型在约98%的题目中使用问题所用语言进行推理,语法性得到改善,同时基本保持通用能力。但SFT无法修复格式错误,也无法阻止答案泄漏到推理通道。采用可验证奖励的强化学习将这两类问题分别从24%降至2.5%、从3.5%降至0%,并使模型遵守“用英语思考”指令的比例提高9.1个百分点。研究团队发布了五个检查点以及配套评估工具。
行业资讯 AI模型 研究 开源 2026-08-22 00:30:58 521 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。