原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.33678
立即前往原文

SWE-Game:编程智能体能打造我们想要的游戏吗?

SWE-Game 是一项包含 247 个任务的基准测试,基于 41 款可执行的 Godot 参考游戏,覆盖 13 种 2D 和 3D 游戏类别。它评估五类任务,包括根据简要说明或设计文档开发游戏、完成项目框架、修复故障游戏,以及将项目从 Godot 移植到 Unity。评估内容涵盖游戏机制的正确性、可玩性、修复效果和视觉呈现。在测试的六个模型中,Opus5 在所有任务类型中均取得最高总分。不过,三项游戏构建任务的最高分都低于 100 分中的 60 分;从简要说明构建游戏的最高分为 50.38。常见问题包括遗漏需求和游戏逻辑错误。在人工标注的行为测试中,可执行检查的表现优于基于视频的视觉语言模型评估器。
行业资讯 应用 AI模型 研究 2026-10-08 13:00:54 610 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。