原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.33642
立即前往原文

利用扰动公共文档进行合成训练,提升模型从上下文中学习的能力

研究人员提出了一套流程:先对公共文档进行轻微改写,再生成依赖文档内容的问题、评分标准和答案,并筛除实际上不需要源文档上下文的样本。该流程无需人工标注,便从3,500份文档中生成了约1万个训练样本。监督微调使Qwen3.6-35B-A3B学生模型在CL-bench上的得分从13.7%提升至22.8%;随后进行基于评分标准的强化学习后,得分达到24.6%。在该基准测试中,其表现接近参数量超过一万亿的模型。长上下文理解、指令遵循和推理能力也得到改善,而知识与代码生成能力基本没有变化。
行业资讯 AI模型 研究 2026-09-29 12:01:25 110 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。