WEFT:扩展通用智能体的工具使用后训练
WEFT 将可扩展的智能体系统构建、由执行结果驱动的迭代改进和稳定的后训练结合起来,用于训练工具使用智能体。它不只扩展可执行环境,还纳入任务、智能体 harness 和评估器。该方法利用执行轨迹定位失败原因并修改相关组件,同时通过采样和信用分配技术提升训练稳定性。MegaMCP 在并发运行时管理相互隔离且可恢复的状态。据报告,在 BFCL V4、τ²-Bench 和 Claw-Eval 上,8B 与 14B 的 WEFT 模型均优于同规模的环境扩展基线。与 Agent-World-14B 相比,WEFT-14B 分别提升 6.41、2.23 和 12.27 个百分点。WEFT-35B-A3B 还在难度更高的长流程工作基准上进行了评估。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。