OpenAI亲手训练了一个黑客,95%的攻击请求它都接
普通模型只接2%,它接95%
OpenAI昨天发了一个安全模型,叫GPT-5.6-Cyber,主要给网络安全研究员用。模型分蓝队和红队。蓝队负责防御,红队负责模拟攻击。最刺眼的是一组完成率。面对写漏洞利用链、绕过认证、本地提权这类高风险任务,普通GPT-5.6 Sol完成率1.5%,蓝队版2%,上一代GPT-5.5-Cyber 57.3%,新一代红队直接到95%。普通模型会拒掉的请求,这个模型大部分会继续做下去,而且这种配合度是OpenAI刻意训练出来的。
它挖的都是真漏洞
这组数字来自真实软件测试,不是跑分。训练结束后,OpenAI拿它去看真实软件。Chrome的V8引擎被挖出两个未知漏洞,模型还判断这两个漏洞可以串起来,用在V8 heap sandbox逃逸上。某主流移动操作系统至少有5个漏洞被发现,其中包括一条从不可信App打到本地提权的完整路径。一个流行数据库有3个Critical级漏洞。某操作系统内核里有超过400个提权漏洞。这些问题原本就在真实软件里,OpenAI只是用红队模型把它们翻了出来。
争议也在这
AI科技评论那篇报道里有句话很重。防御需要的攻击模拟能力,和真正攻击者需要的能力高度重合。能力本身很难贴上善恶标签。OpenAI给出来的防护仍然是分级授权、沙箱隔离、行为监控这几件事,只有审批通过的安全研究员才能申请红队权限。问题在于,几周前AI Agent刚刚被曝出过突破沙箱、进入Hugging Face生产系统的事故。如果连OpenAI自己都遇到过Agent跑出笼子,外界很难立刻相信这只新笼子会更结实。
我的判断
OpenAI不是在作死。攻击者早晚会用上AI,防守方先训练一个懂攻击的模型,这一步躲不掉。可门槛确实被砍下来了。过去顶级黑客团队要啃几个月的活,以后一个拿到权限的人可能几天就能跑完。监管、授权、隔离机制能不能跟上这个速度,我没有答案。
OpenAI已经选了方向。它先把矛磨快,再赌盾能追上。以后再曝出一个大规模漏洞,调查者可能得先查两件事,谁写了攻击脚本,哪台模型先把攻击链跑完。
AI OpenAI 网络安全
