原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.18423
立即前往原文

FM-Bench:评估竞争代理长期管理能力的基准测试

FM-Bench评估语言模型代理能否在行动后果不断累积的长期环境中持续做出有效决策。每个代理使用26种工具和约340至400个决策节点,管理一支足球俱乐部20个游戏内赛季。它需要组建阵容、交易球员、谈判合同、投资设施和青训、安排首发,并向有权解雇它的董事会负责。最终分数由确定性引擎计算,不使用LLM裁判或人工评分。在针对15个前沿模型的单人赛和共享世界Arena测试中,所有模型都完成了整个周期。Claude-Fable-5在两项测试的平均分中均排名第一,但共有10个模型轮流夺冠,排名直到后期才稳定。模型规模、价格和供应商都无法预测表现。得分较高的模型在后期减少回报较慢的投资,让现金保持运转,并更早开始续约。代币消耗与成绩无关。项目代码已在GitHub公开。
行业资讯 AI模型 研究 开源 2026-08-20 11:00:48 848 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。