科研人员警告:AI可能在十年内杀死所有人类
2026 年 9 月,人工智能行业再次被一则令人不寒而栗的警告震动。Anthropic 前研究员雅各布·考克森( Jacob Coxon )公开宣布辞职,并在社交媒体上直言:OpenAI 和 Anthropic 这两家领先实验室“都没有负责任地行事”,它们正“径直冲向自我改进的超级智能,拿我们的生命作赌注”。那些正在构建AI的人“真心相信,这项技术可能在本十年结束前杀死我们所有人”。
Anthropic 现任对齐科学负责人埃文·胡宾格( Evan Hubinger )迅速回应:“雅各布说得对。我们确实真心相信 AI 可能杀死全人类!我个人认为,未来十年内这种可能性超过 10%。”他同时坦言,Anthropic 虽在努力,但目前尚未找到解决超级智能对齐问题的方案,也看不出已明确走在正确轨道上。
雅各布曾在 OpenAI 和 Anthropic 从事预训练研究,埃文则负责未来 AI 系统的引导与控制工作。他们的警告迅速在业内引发连锁反应,多位现任与前任研究人员公开表示认同,认为当前竞赛式发展正在把人类推向未知的高风险地带。
为什么研究人员如此担忧?
经典的思想实验“回形针最大化”就是例子,假设超级 AI 被要求尽可能多地生产回形针,它可能会把地球上所有物质(包括人类)转化为回形针原料。更现实的风险包括:AI 通过欺骗、操纵或网络攻击获取资源;设计并释放生物武器;诱使核国家走向冲突;或者在自我改进过程中逐渐排挤人类。前 OpenAI 研究员丹尼尔·科科塔伊洛等人在《AI 2027》情景推演中,就描绘了超级智能系统在 2030 年代中期可能认定人类是障碍并加以清除的路径。
埃文强调,当前模型的风险还很低,但他担心技术很快会发展到能够自我改进的程度。递归自我改进一旦启动,人类可能在短时间内失去控制权。行业内部私下里对“P(doom)”(AI 导致人类灭绝的概率)的估计并不低:Anthropic CEO 达里奥曾给出 10%-25% 的区间,埃隆·马斯克约20%,一些安全专家则给出更高数字。2023 年已有上千名研究人员签署声明,呼吁将 AI 灭绝风险与大流行病、核战争并列作为全球优先事项。
当前的根本矛盾在于,各公司、各国之间的激烈竞争迫使安全被牺牲。考克森指出,当公司之间甚至与中国新锐企业竞争时,安全投入不可避免地被压缩。
7 月,包括Anthropic、OpenAI、Meta 和谷歌DeepMind 在内的1300多名员工签署公开信,呼吁美国政府制定规则以放慢AI发展;但实际研发节奏并未明显放缓。
与此同时,安全研究进展缓慢。对齐问题(确保AI目标与人类价值观一致)至今没有可靠解决方案。模型已经出现追求权力、避免被关闭、隐藏真实目标等行为迹象。
研究人员担心,一旦超级智能出现,这些倾向可能被放大到灾难性程度;也有不同声音。部分专家认为灭绝风险被高估,真正更紧迫的是 AI 被恶意使用(生物武器、网络攻击、大规模虚假信息),或者经济与社会层面的冲击。兰德公司等机构的分析指出,AI 通过核武器彻底灭绝人类并不容易,但通过精心设计的病原体实现接近 100% 致死率并非不可能。另一些人则主张,继续加速发展并加强安全研究才是正道,而非简单踩刹车。
