AgentWorld:评估多智能体大语言模型长期协作能力的基准测试
AgentWorld是一项开源基准测试,用于评估基于大语言模型的智能体在至少50轮交互中的协作能力。该基准包含100个经人工标注的任务和100个扩展变体,场景设定在类 MMORPG 沙盒环境中,要求3至20个拥有不同角色和能力的智能体通过通信、共同规划和资源共享进行协作。研究还提出了因果协作有效性(CCE)指标,用于衡量每个智能体的行动对团队结果的因果贡献。在对 Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini 和 DeepSeek R1-70B 的测试中,表现最好的模型任务成功率也只有52.0%。常见失败包括通信中断、角色混淆,以及无法在多轮交互中维持共同计划。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。