马斯克用“暴力美学”砸出来的Grok 4.6,终于挤进了全球第一梯队;
而曾经靠“四两拨千斤”杀穿硅谷的DeepSeek,这次悄悄更新的V4 Pro,却让人嗅到了一丝狂热退去后的冷酷现实。
权威AI测评机构Artificial Analysis刚更新的智能指数,综合了“人类终极考试”(Humanity's Last Exam)、GPQA Diamond、SciCode等9项硬核测试。
Grok 4.6直接飙出了61分的高分。
这是什么概念?
它不仅跟OpenAI天花板级别的GPT-5.6 Sol平起平坐,离榜首Anthropic的Claude Fable 5(62分)和Opus 5(63分)也仅仅是一步之遥。
大家以前总觉得老马在社交平台上发表情包是整活,没想到人家在孟菲斯数据中心把电力拉满、把GPU堆成山,是真的大力出了奇迹。
Grok从早期的“嘴替搞笑担当”,一路逆袭成能跟Claude和GPT正面硬刚的顶级智体。事实再次证明,在绝对的算力轰炸和工程堆叠面前,花里胡哨的技巧只能决定下限,只有核电站级别的资源供给才能冲破上限。
而另一边,引发无数期待的DeepSeek v4 Pro 0813 Max,跑分却定格在了53分。
这个数字多少有点令人唏嘘。它不仅没能冲进第一阵营,甚至落后于OpenAI中端定位的GPT-5.6 Terra Max(57分),只能跟轻量级的GPT-5.6 Luna(52分)在同一区间排排坐。
更值得注意的是,在国产大模型的内部战线里,Kimi K3 Max以60分的惊艳表现高居全球第5,Qwen3.8 Max也拿下58分,而DeepSeek这次则与智谱GLM-5.2(53分)手拉手勾肩搭背。
这也是为什么这次科技圈的讨论声远不如上次那般排山倒海。
当初DeepSeek V3和R1横空出世,用极具创造力的架构和开源精神,给昂贵无比的硅谷巨头们上了一堂极其震撼的“性价比课”。
但当竞争进入涵盖复杂代码生成、高阶数学与终极推理的“深水区”时,算法创新的奇迹,终究要面对物理世界最沉重的重力——硅谷巨头万亿级算力日夜不停轰鸣的基建壁垒。
现在的AI顶级战场,正在形成一种极其微妙的格局。OpenAI用天体级别的命名法,把模型划分为Sol(太阳/顶级算力)、Terra(地球/主力干工)和Luna(月亮/轻量端侧)。
而Claude和Grok则在60分以上的神仙区筑起高墙。
国内战队里,Kimi凭借长文本与高阶推理的组合拳切入极高分段,展示了极强的爆发力;而DeepSeek的平静,恰恰标志着大模型行业正从“技术核弹的惊艳”,步入“工程与算力持久战的拉锯”。
神话不可能一个月创造一次,也没有任何一家企业能凭一己之力永远统治跑分榜。
天下武功唯快不破,但AI终局唯算与智不败。
当马斯克用电力和硅片把Grok轰上神坛,当DeepSeek从极速神话走回长跑赛道,这场世纪竞赛才刚刚展现出它最真实、也最残酷的全貌。
你以为你在看一份跑分图表,其实你看到的是人类智力天花板在万亿算力撞击下,每一次惊心动魄的微小撬动。
