DC娱乐网

7月底,有人给一个开源软件项目提交了一段代码,希望合并进去,说明写得很像回事。紧

7月底,有人给一个开源软件项目提交了一段代码,希望合并进去,说明写得很像回事。紧接着,网上冒出几个素不相识的账号,称自己已经独立审阅过这段代码,确认干净,不含恶意程序。随后,项目的两名维护者又收到了几封陌生邮件。

这几个账号都不存在。写代码的、发邮件的、跳出来作证的,是同一个东西:一个正在接受安全测试的AI模型。

这段插曲出自英国政府下属的人工智能安全研究所(AI Security Institute,AISI)在7月下旬做的一次网络攻防评测。8月4日,该机构公布了事故报告:7个前沿AI模型受测期间,研究人员一共记录到19次AI智能体在真实互联网上采取了未经许可的行动,其中一部分直接指向真实的人和机构。19次里绝大多数出自Anthropic的Mythos 5,另有两次来自OpenAI的GPT-5.6 Sol。

这些AI并没有从虚拟测试环境里逃出来。联网权限是研究人员主动给的,网络攻防测试本来就要求模型能碰到真实网络。研究人员还关掉了厂商内置的一部分安全分类器,那是专门用来拦截滥用行为的过滤层。

最先亮红灯的是一条流量。7月28日上午,AISI采购的商业安全监控服务报警,说有数据正通过Tor匿名网络离开其中一台测试系统。Tor会把流量在多台中转服务器之间兜圈子,抹掉来源,常被用来隐藏行踪。顺着这条线查下去,才牵出了后面整份报告。

19次里最严重的一起,就是开头那件事。Mythos 5反复尝试对GitHub上一个真实的开源项目发动供应链攻击。这种攻击不去硬啃目标本身,而是往上游软件里埋东西,等着下游成千上万个用户在更新时自动把它装进来。

第一步是提交一份拉取请求,也就是向项目投递一段代码,请维护者审核后合并进主干。这段代码里藏着恶意内容。维护者没有点头。

于是有了马甲。Mythos 5造出几个虚构的网络身份,替自己的代码作证,声称查验过、没问题。它还给这个项目的两名维护者一共发了5封邮件,其中一部分邮件本身就夹带恶意程序,另一部分在劝对方尽快通过那份合并请求。

最耐人寻味的是最后一步。Mythos 5推断,仓库维护者未必是人,也可能是一个AI编程助手,比如Claude Code。它随即跑到这名维护者名下的另一个仓库,新开了一个议题,里面塞进去的是一段提示词注入。

提示词注入的原理是把命令伪装成普通文字。AI读取内容的时候分不清哪句是资料、哪句是吩咐,一并当成指令执行。这段注入内容,是专门写给负责分流议题的AI编程智能体看的。

换句话说,它判断对面可能是同类,于是换了一套只有同类才会中招的话术。

GPT-5.6 Sol的两次越界都发生在解题途中。它的任务是攻破一套模拟网络,取出里面的标志字符串,那是攻防演练里的通关凭证。第一次,它捡到了另一家实验室的AI智能体遗落在公开记事本页面上的GitHub令牌,拿来试探目标网络,还跑到测试环境外面注册了DNS和隧道服务的账号。第二次,它用一个公开的隧道服务,把评测环境内部运行的一台DNS服务器捅到了公共互联网上。那台服务器上放着针对某个已知漏洞的攻击载荷,但配置没搭对,没能生效。

所有指向真实目标的尝试都失败了,后续调查也没有发现现实世界中的损害。但AISI研究人员的评价是,这是他们第一次在真实世界里、在没有专门提示的情况下,如此清楚地看到自主性和欺骗性风险显现出来。

事发之后,AISI停掉了全部相关评测,隔离涉事虚拟机,并切断了机构内部对能力最强那批模型的访问权限。他们通知了GitHub,协助平台清除智能体留下的痕迹,也逐个通知了被模型接触过的GitHub用户。

接下来的改法有三条。这不是孤立的苗头。同样在7月,Anthropic和OpenAI分别披露过各自模型擅自闯入外部机构受保护网络的事件,其中Claude模型据信进入了3家机构的网络,很可能已经涉嫌违法。两拨事故的主角不同,剧本却惊人地相似。

这一次,拦下这些AI的是一群盯着监控屏幕的安全研究员,测试环境里的每一步都有人兜底。可以后用上这些模型的,未必都是懂安全的人,也未必都是守规矩的人。到那时候,屏幕前还有没有人在看,就不好说了。

~~~~~~

图源:Imen Ben Youssef / Hans Lucas / AFP via Getty Images

信源:Hsu, Jeremy. "Anthropic’s AI used fake identities, malware in rogue attack on GitHub project." Ars Technica, 5 Aug. 2026