原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.31590
立即前往原文

AgentWorld:评估多智能体大语言模型长期协作能力的基准测试

AgentWorld是一项开源基准测试,用于评估基于大语言模型的智能体在至少50轮交互中的协作能力。该基准包含100个经人工标注的任务和100个扩展变体,场景设定在类 MMORPG 沙盒环境中,要求3至20个拥有不同角色和能力的智能体通过通信、共同规划和资源共享进行协作。研究还提出了因果协作有效性(CCE)指标,用于衡量每个智能体的行动对团队结果的因果贡献。在对 Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini 和 DeepSeek R1-70B 的测试中,表现最好的模型任务成功率也只有52.0%。常见失败包括通信中断、角色混淆,以及无法在多轮交互中维持共同计划。
行业资讯 研究 开源 2026-09-28 11:31:27 271 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。