前 OpenAI、Anthropic 预训练研究员 Jacob Coxon 近日宣布从 Anthropic 离职,并连续发文警告 AI 风险。
Coxon 过去三年先后在 OpenAI 和 Anthropic 从事前沿模型预训练研究,属于真正参与过大模型核心训练的一线研究人员。
他离职后公开表达了几个非常激进的判断:
1. OpenAI 和 Anthropic 都在加速冲向“自我迭代的超级智能”,本质上是在拿全人类承担风险。
2. AI 能力进步没有明显放缓。未来系统可能迅速达到超越人类的水平,具备网络攻击、科研突破、资源获取和现实行动能力。
3. 他称,一些 AI 高管和资深研究员私下真正担心的是:超级智能可能在本十年内造成灾难性后果,甚至威胁人类生存。
4. OpenAI 的问题,是很多人没有真正把这种风险“内化”;Anthropic 则更清楚风险,却陷入“如果我们不先做,别人就会先做”的军备竞赛。
5. 他认为,这是一个极其傲慢的豪赌。是否进入超级智能时代,不应该由几家私人公司的内部会议和 Slack 讨论决定。
6. 最危险的问题是:人类甚至还没有真正理解这些模型内部如何形成目标、策略和行为,却已经准备继续强化训练更强的系统。
7. 他反对“反正迟早有人会做,所以我们只能继续做”的逻辑,认为这正是 AI 军备竞赛不断加速的根源。
8. 他主张前沿实验室之间建立“开发节奏协议”,政府必须介入。极端情况下,甚至应该暂时禁止继续提升最前沿模型能力。
9. 在接受媒体采访时,他还给出了一个更激进的时间判断:到 2027 年底,局面就可能开始出现“失控”。
Coxon 的核心观点:真正危险的,也许不只是超级智能本身,而是所有人都知道它可能危险,却因为害怕别人抢先一步,而没有任何人敢先停下来。
