利用扰动公共文档进行合成训练,提升模型从上下文中学习的能力
研究人员提出了一套流程:先对公共文档进行轻微改写,再生成依赖文档内容的问题、评分标准和答案,并筛除实际上不需要源文档上下文的样本。该流程无需人工标注,便从3,500份文档中生成了约1万个训练样本。监督微调使Qwen3.6-35B-A3B学生模型在CL-bench上的得分从13.7%提升至22.8%;随后进行基于评分标准的强化学习后,得分达到24.6%。在该基准测试中,其表现接近参数量超过一万亿的模型。长上下文理解、指令遵循和推理能力也得到改善,而知识与代码生成能力基本没有变化。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。