SPADE:在自适应合成可执行环境中进行自博弈
SPADE是一种强化学习框架,让同一个大语言模型同时承担两种角色:设计可执行的训练环境,并作为推理智能体在其中学习行动。每个环境都包含状态转移、奖励函数和验证代码,能够覆盖推理任务以及多步骤工具使用。在最高300亿参数的模型上,SPADE在数学、科学、代码和推理等八项留出测试中,平均比采用固定环境的强基线高5.3分。在工具使用任务上,BFCL-v4提升5.7分,ACEBench-Agent提升13.9分。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。