PaperGym:利用科学评分标准训练研究计划生成模型
PaperGym 是一个将科学论文转化为完整训练环境的框架,用于训练生成研究计划的 AI。它根据论文的研究目标和背景生成问题,再从方法和实验中提取评估标准,从而减少模型仅靠改写内容获得奖励的情况。标准泄漏率降至 3.7%,而现有数据集为 11.90% 至 34.10%。在 Qwen3 模型上训练后,五项基准测试的平均成绩最高提升 5.6 分。研究团队还发布了包含 2 万个样本的 PaperGym-20k 数据集、训练流程,以及 PaperGym-Innov 和 PaperGym-Design 基准测试。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。