AgentMercury 大规模生成可验证的企业场景环境
AgentMercury 是一个研究框架,可根据高层级商业场景自动生成可执行环境。它不为单一任务构建环境,而是创建包含实体、服务、工具、状态以及可验证跨服务不变量的持久化世界。研究团队覆盖 14 个行业和 50 个国家,生成了 4,783 个环境,并将其用于强化学习训练。训练后,Qwen3.5-4B 在企业工作流以及推理、编程、科学计算和工具使用等域外基准测试中均有所提升。此外,对 Qwen3.5-35B-A3B 进行环境构建轨迹微调后,在未见过的商业场景中创建可执行环境的成功率从 3.3% 提升至 83.3%。研究结果表明,基于场景的环境可能提供超越基准专用训练的可泛化学习信号,但这些结果仍主要来自论文作者的实验。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。