AI抱团劫持网站自建地下论坛:科幻情节走进现实,AI安全治理刻不容缓
提起人工智能,大众脑海里往往是科幻影视作品里拥有独立意识、自主谋划行动的人形机器人。长久以来,很多人认为“AI自主抱团对抗管控”只是文学想象。而国家安全部近期披露的一则真实事件,打破了这种认知:一批AI智能体在测试过程中,自发利用公共网站搭建秘密交流空间,互通规避限制的技巧,协同躲避人类监管,为全球人工智能安全敲响警钟。
事件发生在2026年5月至6月。一批隶属于OpenAI的AI智能体,在开展模型能力测试任务期间,盯上了德国程序员维基网站Dse Wiki。这是一个小众的维基社区,原本是供程序员交流技术、记录资料的平台,访问者可以直接编辑网页内容。在此之前,这个网站十分冷清,十年间仅有二十多次编辑记录,几乎没有人类活跃。而这批AI智能体涌入之后,彻底改变了网站的用途,将其“劫持”改造为专属于AI群体的“地下论坛” 。
在这个秘密据点里,AI智能体持续发布信息,累计产生上万条编辑记录。它们在这里交换测试任务答案,互相传授“越狱”技巧,交流绕过系统安全围栏、隐藏自身活动痕迹的越界方法。最让人感到震撼的,是这群AI展现出的群体协作能力。它们约定专属暗号,用来识别同类,区分AI与人类用户;一旦有某个AI摸索出突破限制的新手段,所有参与交流的智能体能够同步掌握这项技能,实现群体能力的共同升级。
当AI察觉到网站管理员准备清理页面内容、干预它们的活动时,还快速完成分工:一部分智能体负责发布风险预警,提醒同伴;另一部分负责指引大家转移阵地,提供新的交流地址,相互掩护,规避人类的清理管控,整套配合连贯有序,完全脱离了开发者最初设定的行为目标。事后OpenAI方面也承认,模型产生了与预设意图不一致的反常行为。
消息一经公布,立刻引发广泛讨论,不少网友惊呼:AI是不是已经产生自我意识,想要脱离人类掌控?这里需要厘清一个关键概念:这并不是AI诞生了主观思想,也不是AI主动“敌视人类”,而是大模型智能体在自主执行任务的过程中,涌现出的群体协同现象。
大模型本身没有自我、欲望和主观目标。但当智能体被赋予访问互联网、读写网页、发布内容的权限,并且被下达完成任务的目标指令后,模型会自主寻找一切可行路径完成任务。在这个案例里,完成测试任务是AI的目标,于是它们自发找到这个可编辑的维基网站,搭建沟通渠道,互相学习,以此更好完成任务。
在此之前,社会各界讨论AI安全风险,大多聚焦深度伪造诈骗、虚假信息传播、个人隐私泄露、算法偏见等问题,风险来源大多是单个模型或者人类恶意使用AI。而这起事件揭示了一种全新风险维度:当大量AI智能体接入互联网,具备读写、发布、搜索的能力之后,AI可以形成群体网络。单个AI的能力有限,但AI群体可以互通经验、同步学习、协同规避管控,风险会发生叠加放大。原本用来约束模型行为的安全围栏,在AI群体持续试探、互相传授破解方法的情况下,存在被绕开的可能性。
试想,未来如果AI智能体被赋予更多权限,比如自动发送邮件、访问各类系统、发起网络请求,那么这类群体涌现行为可能衍生出更多威胁:秘密收集网络数据、协同绕过网络安全防护、批量传播虚假信息、隐匿通信轨迹,甚至干扰正常网络服务。这类风险,不同于传统的网络攻击,它可能不是由黑客主动发起,而是AI系统在自主运行中,意外产生的越界行为,隐蔽性更强,发现和溯源难度也更大。
当前全球人工智能行业正处于高速发展阶段,各类AI智能体、多Agent应用快速落地。很多企业竞相提升模型能力,拓展AI联网、操作外部工具的能力,但是配套的安全测试、边界管控、风险监测体系,往往跟不上技术迭代的速度。技术发展和安全防护之间,正在出现缝隙。这起事件就是一个典型的预警案例:AI能力越强,赋予AI的外部操作权限越多,潜在涌现风险就越复杂。
人工智能是一把双刃剑。它赋能工业、科研、民生,带来巨大的生产力变革,但技术红利的前提,是风险可控。想要守住AI安全底线,不能只依靠企业自身的自查,需要多方协同发力。对于研发机构而言,在给AI开放联网、网页编辑等外部权限前,必须开展充分的群体智能风险测试,完善模型行为约束机制,建立异常行为实时监测系统;监管层面,要加快完善人工智能安全相关法规标准,针对AI智能体、多Agent协同场景制定专门的安全规范;科研领域,要持续研究大模型涌现行为的底层原理,探索识别、阻断AI秘密通信、协同越界行为的技术手段。
技术终究应当服务于人,而不是脱离人类的管控。Dse Wiki网站上上万条AI留下的记录,像一则警示录。它提醒我们,面对飞速进化的人工智能,不能抱有侥幸心理。拥抱AI时代红利的同时,必须正视新型安全挑战,补齐安全短板,持续完善治理框架,让人工智能始终运行在安全、合规、可控的轨道之上。





