SKILLER:通过语言级强化学习从小型语言模型中提取可复用技能
SKILLER 是一个强化学习框架,能够自动为小型语言模型生成适配执行器的专属技能。该方法让更强的模型同时担任行动者和评判者,并将小模型智能体系统作为环境,所有强化学习信号均通过自然语言传递。研究人员使用 Qwen3.5-9B 和 Qwen3.5-4B,在五项基准测试中将其与三种开源方法和一种闭源方法进行比较。9B 模型的绝对提升幅度为 4.3 至 20.4 个百分点,4B 模型为 1.8 至 13.3 个百分点。在 SkillsBench 的单技能任务中,SKILLER 的表现达到强大闭源模型的水平。项目代码已在 GitHub 上发布。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。