OpenAI训练AI黑客挖漏洞:高危任务完成95%,普通模型不到2%
OpenAI这次没急着发聊天机器人,而是扩展了一个叫Daybreak的网络安全计划,推出专门打攻防的模型GPT-5.6-Cyber。它把AI分成两队:蓝队负责防御,红队负责模拟黑客攻击。真正被重点训练、还公布了成绩单的,是负责攻击的红队。
红队的成绩有点吓人。在零日漏洞挖掘测试里,OpenAI只给它开源代码,不告诉漏洞在哪,让它自己找从没被人发现过的新漏洞。专项训练后的红队模型,高风险安全任务完成率达到95%,普通模型只有1.5%到2%,上一代GPT-5.5-Cyber是57.3%。
更关键的是它不只在考卷上得分。训练完成后,研究人员拿它去查Chrome用的V8引擎,找出了两个此前未知的漏洞;在一个主流手机系统里发现至少5个漏洞,其中一条能从一个不可信App一路提权到本地;在一个流行数据库里发现3个严重漏洞;还在一个主流操作系统内核里找出400多个可能导致权限提升的漏洞。找到一个V8漏洞后,它还会自己判断能不能和第二个漏洞串起来,一路攻到逃出沙箱。
为了让它敢下手,OpenAI主动降低了红队对这类高风险请求的拒绝率——以前AI会拦着不让做的攻击模拟,现在它在沙箱里照做。
争议也卡在这。OpenAI的逻辑是攻防同源,防御者得先懂怎么攻;但批评者指出,"模拟攻击能力"和"真实攻击能力"用的是同一套本事,模型越强,万一被授权不当或被人绕过,能造成的破坏也越大。OpenAI目前只对授权安全人员分级开放,配了沙箱和二次拦截,可这些防护手段还是老几样:权限控制、沙箱隔离、行为监控。
AI替你修漏洞的速度在变快,可它替人找漏洞的速度跑得更快。盾和矛谁先到普通人电脑前,这事现在没人敢打包票。
AI OpenAI 网络安全