原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.20634
立即前往原文

AgentMercury 大规模生成可验证的企业场景环境

AgentMercury 是一个研究框架,可根据高层级商业场景自动生成可执行环境。它不为单一任务构建环境,而是创建包含实体、服务、工具、状态以及可验证跨服务不变量的持久化世界。研究团队覆盖 14 个行业和 50 个国家,生成了 4,783 个环境,并将其用于强化学习训练。训练后,Qwen3.5-4B 在企业工作流以及推理、编程、科学计算和工具使用等域外基准测试中均有所提升。此外,对 Qwen3.5-35B-A3B 进行环境构建轨迹微调后,在未见过的商业场景中创建可执行环境的成功率从 3.3% 提升至 83.3%。研究结果表明,基于场景的环境可能提供超越基准专用训练的可泛化学习信号,但这些结果仍主要来自论文作者的实验。
行业资讯 应用 AI模型 研究 2026-08-24 11:31:01 857 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。