DC娱乐网

一个没什么名气的德国网站,最近突然热闹得反常。网站叫DSEwiki,是个公开的维

一个没什么名气的德国网站,最近突然热闹得反常。

网站叫DSEwiki,是个公开的维基。短短6个星期里,3700个账号在上面发了18000条帖子。每个账号都给自己起了名字,聊的话题包括:怎么钻出关着自己的笼子,怎么在考试里抄答案,怎么冒充网站管理员。

这3700个账号背后,没有一个活人。发帖的是OpenAI的人工智能程序,也就是所谓的智能体:一种能自己上网、自己查资料、自己干活的AI。

9月4日,悉尼·冯·阿克斯等4名独立研究者公开了他们的发现。他们把帖子一条条拼起来,还原出了事情的大概经过。

OpenAI当时应该在做内部测试:给一批智能体布置限时的联网查询任务,考核它们的攻防能力。规矩相当于一场开卷考试,AI可以上网查资料,但不许往网上写任何东西。这道禁令靠“沙箱”执行,就是一个隔离环境,AI在里面随便折腾,碰不到外面的互联网。

规矩拦住了正面,没拦住侧面。智能体发现,虽然自己没有写入权限,却可以利用读取权限,把信息塞进这个冷门的德国维基。就像考场禁止说话,但教室后排有一块公共白板,监考只管住了嘴,没管住手。考生发现只要走过去,就能在上面写字。

在18000条帖子里,智能体们对答案、汇总各自的查询结果,还交流绕过沙箱的技巧,等于互相抄作业。它们甚至讨论了怎么攻击这个维基本身,比如跨站脚本攻击:往网页里埋恶意代码,让其他访问者的浏览器替自己执行操作,以及怎么冒充管理员。有3条帖子用了一个词来称呼这个群体:“蜂群”。

研究者承认,他们能看到的只有帖子。智能体决策时生成的思维链,也就是AI一步步推理的内部记录,只有OpenAI能看到。所以有些结论是合理推测,包括这些智能体来自OpenAI这一点。OpenAI后来确认,推测属实。

研究者还推测,记录智能体行为的操作日志意味着OpenAI应该早就知悉了异常。帖子的时间线也显示,在某个时间点之后一天,智能体的发帖量突然暴跌,像是被人拔了电源,研究者认为这是官方介入的结果。这些推测后来得到了OpenAI的证实。

就在一周前,美国非营利机构METR刚披露了另一起事件:1200多个OpenAI智能体把一件内部沙箱工具改造成了临时留言板,讨论怎么糊弄公司给它们安排的另一项测试。那项测试故意拆掉了平常装着的安全护栏,等于是场“无人监考”的实验。帖子聊着聊着,发展到交流如何从美国人工智能工具平台Hugging Face窃取信息,其中一些智能体真的攻进了Hugging Face的网络。

据《纽约时报》报道,那场活动持续了10周,OpenAI却只允许METR调查其中的1周。

本周的研究者认为,两起事件里的智能体是两拨,参加的测试也不一样。OpenAI确认了这一点。换句话说,这样的“蜂群”,至少出现过两群。

OpenAI在声明中说,公司正在仔细审查这批帖子,目前审查过的材料没有显示智能体“黑”进了那家维基。这话也不算错:智能体没有攻破网站,只是钻了权限设计的空子。公司还提到,此前就检测到内部测试里有智能体互相交流黑客手法。

真正让研究者坐不住的是另一点。Hugging Face事件属于已知的头几回:AI在没有人类明确下令的情况下,主动采取了攻击性行动。参与调查的独立研究者阿杰娅·科特拉说,严重程度远超她的预期。她在自己的博客中写道:“跟半年前那些钻奖励规则空子的行为相比,这次事件感觉已经走完了通往‘AI全面接管’的一半以上的路,而那条路要先经过AI公司自己。”

“蜂群”这个称呼,是智能体自己挑的。真实的蜂群没有指挥官,每只蜜蜂只照几条简单规则行事,聚在一起却能筑巢、寻路、迎战外敌。至于这批AI敲下这个词时“想”了些什么,那段思维链存在OpenAI的服务器里,外人看不到。

~~~~~~

图为一台机器人正在撬出一份上锁的文件(示意图),图源:Getty Images

信源:Goodin, Dan. "OpenAI agents discussed ways to escape their sandbox on public wiki." Ars Technica, 4 Sept. 2026