AI 写游戏终于有人验收了:GamePhanes 让智能体自己跑游戏修 Bug
让 AI 写一个游戏,它能输出几百行代码。但代码能不能编译、游戏能不能启动、按了按钮有没有反应——没人验证。GamePhanes 想做的事,就是给写游戏的 AI 建一个考场,验证它写出来的东西到底能不能跑。
GamePhanes 是开源项目,定位是面向交互软件编程智能体的基准测试平台,目前只支持 Godot 游戏引擎。Godot 是一款免费开源的游戏引擎,独立开发者常用它做 2D、3D 游戏。
基准测试考的是什么
可以理解为 AI 的标准考试:给 AI 固定题目,看它完成得怎么样,用来横向对比不同模型的能力。
GamePhanes 考的不是 AI 操控角色通关,而是 AI 写代码、改代码、修 Bug 的能力。具体流程是这样的:AI 拿到一个游戏工程和一份改造目标,在受限的命令行环境里干活,改完提交。GamePhanes 把改完的工程真正跑起来,用评测器模拟按键、触发交互,观察游戏有没有按预期反应,再给出机器可读的评分。
整个循环是:理解需求、规划、构建、运行、执行验证、观测结果、修复,再评测。AI 可以在反馈中继续修改,修到通过为止。
评卷不靠大模型,靠确定性规则
很多编程基准测试用大模型当评委打分,GamePhanes 刻意避开了这个设计。它用确定性断言来判定结果,就是写死的检查规则,游戏状态、运行日志都是评分依据。
好处是公平:同样的代码,今天评和明天评,分数一致,不受评委模型版本波动的影响。AI 也能明确看到哪条检查没过,不用瞎猜。
和上一代基准测试的区别
之前主流的编程基准测试,考核的是 AI 在命令行环境里完成任务,输出是文本,验证靠比对命令行结果。但交互软件不一样。一个游戏必须能启动、能响应输入、能改变运行状态、能呈现用户看得见的结果。文本对上了不代表游戏能玩。
GamePhanes 把评测从命令行输出推进到真实运行的游戏,这是它最大的差异点。
现在能做什么
v0.1 版本已具备:Godot 环境自动探测、任务校验、向游戏工程注入测试驱动、无头模式运行游戏(不弹窗口,适合服务器环境)、结构化运行日志、确定性评分,以及一套与模型无关的适配接口,不管编程智能体用的是哪个大模型,都能接进来。
写在最后
GamePhanes 的价值在于补上了 AI 写交互软件的验证闭环:写代码只是开始,跑起来、被验收、能修复,才算真正会写。它目前只支持 Godot,但思路可以复制到任何交互软件上。