原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.19197
立即前往原文

SPADE:在自适应合成可执行环境中进行自博弈

SPADE是一种强化学习框架,让同一个大语言模型同时承担两种角色:设计可执行的训练环境,并作为推理智能体在其中学习行动。每个环境都包含状态转移、奖励函数和验证代码,能够覆盖推理任务以及多步骤工具使用。在最高300亿参数的模型上,SPADE在数学、科学、代码和推理等八项留出测试中,平均比采用固定环境的强基线高5.3分。在工具使用任务上,BFCL-v4提升5.7分,ACEBench-Agent提升13.9分。
行业资讯 应用 AI模型 研究 2026-08-20 10:30:55 472 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。