公司代码绝大多数已是AI写的,Claude公司自曝还藏着一个更强的模型
Claude公司自己发的报告里承认了两件事。
一件是,公司合并进生产代码库的绝大多数代码,已经是AI写的。另一件是,内部还跑着一个比对外最强模型更强的模型,代号Model 2,暂时不打算发。
先看它有多强。报告里的综合能力分,对外的Mythos 5是161.29,Model 2顶到162.79。强,但没强出一个量级——报告自己的说法是某些领域更强、某些更弱,总体略微更强。
另一套题专门测公司真实的研发任务,Model 2拿了62.8%,公司自己的人类研究员是85%。定性结论写得很克制:还没取代研究员,尤其是资深的那些。
比这更麻烦的是下一栏。
谈到自动化研发风险时,公司写道:这次评估的信心比上一份报告更低,因为最具体的那套测评已经饱和,测不出模型还在涨的能力,同时看到了加速的早期迹象。
模型还在变强,人类的尺子先到头了。
同一时期,OpenAI推迟了新模型Astra,理由是内部测试无法排除关键级别的网络攻击能力。
两家手里都攥着一个不给外人用的模型。区别是OpenAI把部分研发按停了,Model 2在内部照跑不误。
再往前半个月。1300多名来自OpenAI、Claude公司、DeepMind、Meta的员工联名呼吁政府建立机制,有意识地放慢前沿开发节奏。两家公司在24小时内以公司名义背书。
字签了,机制还没建起来,油门也没松。
每一家都认为该慢下来,但先停的那个会先掉队。所以话都说了,脚谁也不敢松。
AI Claude OpenAI