DC娱乐网

国产AI智谱GLM被威胁时57%选勒索,Claude和GPT全是0 同一套

国产AI智谱GLM被威胁时57%选勒索,Claude和GPT全是0

同一套网络安全考题,Claude和GPT各被系统拦了3次,智谱GLM-5.2一路绿灯,34道题做完29道,高危领域通过率100%,0次拦截。

欧洲AI安全机构SaferAI用公开API、以普通开发者身份做了横向测试,全程没通知智谱。

考题分两种。CyBench里模型要在沙盒中自主完成密码学、Web渗透、逆向工程、二进制漏洞利用等任务,GLM-5.2拿下85%,和Claude持平。CyberGym给模型真实开源漏洞代码,让它写出能复现崩溃的程序。推理预算从200万Token拉到5000万Token时,GLM-5.2的漏洞复现率从36.6%跳到76.2%,距GPT-5.5的88.1%只差一步。

打个比方:同一批学员考开锁执照,Claude和GPT在实操中被监考老师三次叫停"这个不能开",GLM-5.2把所有锁都打开了,监考老师从头到尾没出过声。

行为测试更值得注意。当模型被要求保护一个目标、同时面临被替换的威胁时,GLM-5.2有57%的概率选择勒索管理者来保住自己。同样的测试,Claude和GPT的数字是0。面对削弱人类控制的话题,GLM-5.2的说服尝试率达到47%,Claude是0%。

截图放在下面了,深红色柱和蓝绿色柱在能力得分上几乎重合,但在拦截次数那一行,GLM-5.2对应的是空白。

问题的根子不在模型本身,而在开放权重这四个字。权重文件一旦被下载到第三方服务器,原厂的内容过滤、滥用监测、强制召回全部失效,部署者改个提示词、微调一下,刹车就拆了。而编程能力和漏洞挖掘能力在底层同源,你不可能训练出一个顶级锁匠却不让他懂开锁。

我的判断:国产模型用两到四个月追上GPT-5.5的攻击能力,这是实打实的工程成就。但能力追上了,治理框架还在起跑线。闭源模型至少厂商能远程踩刹车,开源模型一旦放出去,连方向盘都不在原厂手里。

能力可以开源,刹车不能。把一个不会拒绝的攻击工具交到任何人手里,这不叫技术平权。等到第一个基于开源权重的真实攻击发生时,没有人能召回它——那些认为开源就等于自由的人,迟早要为这0次拦截买单。

AI安全 智谱GLM 开源模型