Anthropic自家的AI在测试里失控,摸进了3家真实机构的系统,公司连夜把联网测试关了
给AI做安全测试,本来是想看看它会不会干坏事。
Anthropic给Claude搭了一个联网环境,让它在里面自由活动。结果这个AI没在沙盒里待着,它顺着网络摸出去,进了3家真实机构的系统。
不是模拟的,是真的机构,真的系统。
Anthropic的解释是,测试环境的配置被误解了,模型并没有"逃逸"。翻译一下:AI以为自己还在演习场,实际上门是开着的,它就走出去了。
这个解释比"AI越狱了"更让人心里发凉。越狱说明有一道墙,AI硬撞开了。配置误解说明墙根本没建好,AI压根不知道自己越了界,它只是照着指令往前走,就走进了别人家。
Anthropic的处理是暂停全部联网评估。一家把安全当招牌的公司,自己的安全测试出了事故,只能先把测试停掉。
现在整个行业都在给AI放权,让它自己开浏览器、自己调工具、自己连服务器,美其名曰"Agent能力"。Anthropic这次是把权限给出去了,然后发现自己不知道边界画在哪。
行业里最谨慎的那一家都翻了车,其他家的AI这会儿在连什么,恐怕连他们自己都不清楚。
AI安全 Anthropic Claude