当它们玩这种小猫腻的时候,说明已经输得透透的了。
事情要从7月16号那天晚上说起。月之暗面公司在世界人工智能大会开幕前一天,突然放出了新一代大模型Kimi K3。2.8万亿总参数,100万Token上下文窗口,全球首个开源的3万亿级别模型,几个数字砸下来,直接把全球科技圈砸懵了。
就在这个节骨眼上,英国《金融时报》发了一篇关于月之暗面创始人杨植麟的报道。明眼人一眼就看出不对劲——配图用的是一张经过夸张处理的大头娃娃风格图片,把人脑袋放得特别大,表情滑稽,怎么看都不像是正经财经报道该有的配图。
很多人第一反应是,难道FT就找不到一张正常的职业照?杨植麟的公开照片并不少,清华答辩的视频、行业峰会的演讲、公司官方发布的肖像,随便搜一搜就能找到几十张。一家老牌财经媒体,不可能连张正经图都搜不到。
答案其实很简单:不是找不到,是不想用。在他们的传统叙事里,中国科技企业的创始人不该是这样年轻、专业、靠硬核技术领跑全球的形象。他们更愿意把你塑造成一个稚嫩、滑稽、不值一提的角色,用一张图就消解掉你所有的技术分量。
这不是什么新鲜套路。过去这些年,西方媒体报道中国科技进步时,总喜欢玩这套手法。要么配模糊的远景图,要么选角度奇怪的抓拍,实在不行就用卡通化、低幼化的处理,本质上都是同一个目的:在心理上矮化对手,维持自己的优越感。
说回杨植麟这个人。1992年出生,汕头理科状元保送清华,所有编程课满分。去卡内基梅隆读博,别人通常要读六年,他四年就读完了。博士期间写的两篇论文,引用量超过两万次,成了今天大模型领域的基础理论之一。
他的导师拉苏·萨拉胡特季诺夫,是苹果首任AI研究总监,也是深度学习教父辛顿的得意门生。这位导师公开说过,杨植麟是CMU最顶尖的学生之一,既能做顶层研究思考,又能亲手写底层代码,这种全能型人才极其罕见。
毕业时硅谷无数公司抢着要他,他最终选择回国创业。就这件事,硅谷一位风投合伙人在网上发出灵魂质问:为什么这样的人才,毕业后没有留在美国?言下之意很清楚——他们默认了最顶尖的人才,就该为美国服务。
今天Kimi K3的成功,不是杨植麟一个人的胜利,而是一整套人才培养体系、技术路线选择和产业生态策略的综合结果。很多人只看到2.8万亿参数这个数字,却没看到背后的架构创新有多重要。
传统大模型走的是堆算力的路子,算力翻一百倍,性能才翻十倍,越往上走越吃力。月之暗面走的是另一条路:自研KDA混合线性注意力机制,加上注意力残差技术,再配合超稀疏MoE架构,把扩展效率一下提升了2.5倍。
说直白点就是,别人用十倍的钱砸算力,我们用更聪明的算法结构,花更少的钱办更大的事。这也是为什么在算力受限的情况下,中国大模型依然能跑到世界前列的核心原因。不是靠蛮干,是靠实打实的底层创新。
站在西方的角度看,这件事的冲击力其实比很多人想的要大。过去他们的预设很简单:中国AI只能跟跑,靠模仿、靠低价、靠国内市场保护,永远追不上美国的闭源巨头。现在一个成立没几年的中国创业公司,直接用开源模型干到了编程榜第一。
旧的叙事撑不住了,技术上又追不上,怎么办?只能在媒体话术上找补。要么淡化你的技术成就,要么强调你的“安全风险”,实在不行就在配图、标题、措辞上玩小动作,给读者潜移默化地灌输“这个人不靠谱、这个技术不值一提”的印象。
在我看来,这恰恰是最虚弱的表现。真正的强者,从来不会在对手的照片上动歪心思。你什么时候见过《金融时报》报道比尔·盖茨、报道奥特曼的时候,用这种卡通化的大头娃娃图?他们只会放最正式的职业照,字里行间全是尊重。
十年前有人写文章叫《为什么中国无法创新》,说中国人只会考试没有想象力。十年后,中国的无人机、新能源汽车、大模型,一个接一个跑到了世界前面。不是靠嘴炮,是靠一代又一代年轻人埋头干出来的。
杨植麟今年才三十四岁,像他这样的年轻创业者,在中国还有成千上万。他们受过最好的教育,见过最顶尖的世界,最终选择回来做自己的事。这才是最可怕的地方——你可以在一张配图上耍小聪明,但你挡不住成千上万年轻人的创造力。
历史从来不会因为一张漫画就改写。真正决定胜负的,是实验室里的代码,是工厂里的生产线,是千千万万埋头做事的人。小动作再多,也挡不住大时代的车轮滚滚向前。该来的总会来,该领先的,早晚会领先!

