原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.36887
立即前往原文

WEFT:扩展通用智能体的工具使用后训练

WEFT 将可扩展的智能体系统构建、由执行结果驱动的迭代改进和稳定的后训练结合起来,用于训练工具使用智能体。它不只扩展可执行环境,还纳入任务、智能体 harness 和评估器。该方法利用执行轨迹定位失败原因并修改相关组件,同时通过采样和信用分配技术提升训练稳定性。MegaMCP 在并发运行时管理相互隔离且可恢复的状态。据报告,在 BFCL V4、τ²-Bench 和 Claw-Eval 上,8B 与 14B 的 WEFT 模型均优于同规模的环境扩展基线。与 Agent-World-14B 相比,WEFT-14B 分别提升 6.41、2.23 和 12.27 个百分点。WEFT-35B-A3B 还在难度更高的长流程工作基准上进行了评估。
行业资讯 AI模型 研究 2026-10-05 23:31:00 393 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。