GameXpert-Bench:编程智能体距离专家级游戏开发还有多远?
GameXpert-Bench用于评估AI编程智能体在完整游戏开发生命周期中的能力。测试包括三个部分:GameGen评估智能体能否根据一次请求创建完整游戏;GameFix评估缺陷诊断与修复能力;GameOpt则衡量多轮交互中的持续优化能力。评估采用实时游戏交互、确定性行为测试,以及带回归检查的最终产品标准。该基准包含11个游戏类型的97项生成任务、100项修复任务,以及17条优化链;每项修复任务都包含19至27个经过人工验证的注入缺陷。现有智能体在创建可玩的基础版本和实现明确要求方面相对可靠,但在发现缺陷、验证运行时行为,以及修改后保持原有功能方面仍存在明显不足。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。