FM-Bench:评估竞争代理长期管理能力的基准测试
FM-Bench评估语言模型代理能否在行动后果不断累积的长期环境中持续做出有效决策。每个代理使用26种工具和约340至400个决策节点,管理一支足球俱乐部20个游戏内赛季。它需要组建阵容、交易球员、谈判合同、投资设施和青训、安排首发,并向有权解雇它的董事会负责。最终分数由确定性引擎计算,不使用LLM裁判或人工评分。在针对15个前沿模型的单人赛和共享世界Arena测试中,所有模型都完成了整个周期。Claude-Fable-5在两项测试的平均分中均排名第一,但共有10个模型轮流夺冠,排名直到后期才稳定。模型规模、价格和供应商都无法预测表现。得分较高的模型在后期减少回报较慢的投资,让现金保持运转,并更早开始续约。代币消耗与成绩无关。项目代码已在GitHub公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。