Roblox 发布的 OpenGameEval 是首个专门针对 Agentic AI 在游戏开发场景表现的开放评测基准。该基准通过模拟 100 个真实游戏开发任务,从代码生成、3D 建模、关卡设计、测试调试等 6 个维度评估 AI Agent 的能力,目标是推动游戏开发自动化领域的 AI 技术进步。

OpenGameEval 的核心创新是任务设计。每个任务都来自 Roblox Studio 真实开发者社区,涵盖编程新手到资深工程师的日常工作。例如,任务一可能是:用 Lua 编写一个角色移动系统,要求支持 WASD 键控制和碰撞检测。AI Agent 需要从零开始实现这个系统并通过 Roblox 模拟器测试。
当前最强模型在 OpenGameEval 上的得分情况:Claude Opus 4.5 综合得分 78.3 分排名第一,展现了在游戏开发场景的强大能力。GPT-5.6 综合得分 75.1 分排名第二。Gemini 3 Ultra 综合得分 71.8 分排名第三。这三个模型的差距主要在测试调试环节,Claude 在自动化测试用例生成上表现最佳。

OpenGameEval 的评测维度设计具有启发性。代码生成 (40% 权重) 测试 AI 写出符合游戏引擎 API 的代码能力;3D 建模 (20%) 测试 AI 生成 3D 模型和场景布局能力;关卡设计 (15%) 测试 AI 设计游戏关卡的创意和平衡;测试调试 (15%) 测试 AI 自动发现和修复 bug 能力;性能优化 (5%) 测试 AI 优化游戏性能能力;多 Agent 协作 (5%) 测试 AI 协调多个 Agent 完成复杂任务。
OpenGameEval 对游戏开发行业的影响正在显现。Roblox 开发者社区已经出现多个基于 OpenGameEval 评测的高分 AI 工具,这些工具可以直接嵌入 Roblox Studio,辅助开发者完成日常工作。Roblox 官方统计显示,使用 AI 工具的开发者项目完成速度提升 35%,新手开发者上手时间缩短 60%。

评测基准的开源属性让更多研究者参与。OpenGameEval 在 GitHub 上开源 6 个月,已经收到来自全球 200 多位研究者的改进建议和任务补充。任务库从最初的 100 个扩展到 150 个,覆盖更多游戏类型和开发场景。这一开源策略让 OpenGameEval 有望成为 Agentic AI 游戏开发的事实标准。
OpenGameEval 也暴露出当前 AI Agent 的局限性。得分最高的 Claude Opus 4.5 在测试调试环节也只有 65.8 分,说明 AI 自动发现 bug 仍是技术难题。多 Agent 协作场景得分最低 (52.3 分),反映出 AI 协调多个 Agent 完成复杂任务的能力还很弱。这些局限性将是 AI Agent 未来 2-3 年的重点突破方向。
OpenClaw—AI研究