HuatuoGPT-3:仅用强化学习实现基础模型领域适配
该研究提出 One-stage Policy Optimization(OnePO),一种仅通过强化学习将大语言模型适配到专业领域的方法。OnePO 将教师模型的输出作为临时指导,并在训练中的模型能够超越这些输出后停止使用。在医疗领域适配中,OnePO 使用 2 万条训练样本,在 HealthBench Total 上取得 67.2 分,高于研究报告的 SFT+RL 和纯 RL 基线。研究团队将该方法扩展至开源医疗模型系列 HuatuoGPT-3;其 27B 版本在 HealthBench Total 上获得 70.1 分,在 HealthBench Professional 上获得 71.4 分。这些是基准测试成绩,本身不足以证明其在临床应用中具有全面优势。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。