DC娱乐网

老黄可能怎么也没想到,自己筑了二十年的CUDA高墙,会被一家年轻的中国大模型公司用最干脆的方式给拆了墙角。   国庆前夕,DeepSeek做了一个让硅谷摸不着头脑的决定:把面向华为昇腾芯片的一整套开发工具和底层高性能算子,直接开源了。   最硬核的地方就在于四个字——一一对应。   以前在英伟达显卡

老黄可能怎么也没想到,自己筑了二十年的CUDA高墙,会被一家年轻的中国大模型公司用最干脆的方式给拆了墙角。
 
国庆前夕,DeepSeek做了一个让硅谷摸不着头脑的决定:把面向华为昇腾芯片的一整套开发工具和底层高性能算子,直接开源了。
 
最硬核的地方就在于四个字——一一对应。
 
以前在英伟达显卡上跑的底层计算程序,现在昇腾上全都有了高性能的镜像版本。同一套代码,两边都能跑。
 
这不是小打小闹的适配,是连根一起搬。
 
看看DeepSeek开源的那串清单:TileLang高级语言编译工具、DeepGEMM矩阵运算加速库、DeepEP跨设备通信库、FlashMLA稀疏注意力算子、DeepSelect数据筛选。六项组件,跟英伟达平台上的版本逐一对应。
 
DeepSeek官方说了一句话,翻译成大白话就是:我们训练V4模型用到的每一个算子,昇腾上都有对应的实现。
 
每一个。
 
这意味着什么。意味着DeepSeek的生产工具链,整套从CUDA那边平移到了昇腾这边。以前开发者想跑DeepSeek的模型,得买英伟达的卡。现在昇腾也能跑,性能接近硬件上限。
 
英伟达的CUDA为什么牛。不是显卡本身有多神,是二十年攒下来的软件生态。开发者用惯了CUDA的库,写代码顺手,迁移成本高。你换一块别家的卡,光是重新适配算子就得折腾半年。
 
DeepSeek干的事,就是把这条迁移路给你铺平了。
 
DeepSeek创始人梁文锋几个月前在一场闭门会上说了句话,被媒体挖出来:使用国产芯片训练大模型,是必须成功的方向。他甚至算过一笔账,训练顶级模型如果用华为昇腾950,大概需要二十万颗;如果用英伟达GB300,五万颗就够。
 
芯片数量差四倍。但梁文锋还是要走这条路。
 
为什么。因为英伟达的高端卡,中国买不到了。美国出口管制卡着脖子,你算力再强,拿不到货就是零。DeepSeek开源昇腾工具链,等于告诉全世界开发者:想跑我的模型,不一定非得用英伟达。
 
英伟达自己都承认了这个风险。最新季报里写得很直白:美国的出口限制实际上把英伟达挡在了中国数据中心市场外面,这帮助竞争对手建立了更大的开发者生态来挑战我们。
 
这话是英伟达自己说的。不是别人吓唬它。
 
黄仁勋今年四月上播客节目,被问到最怕什么。他说如果有一天DeepSeek首发在华为芯片上,对英伟达就是“灾难性的结果”。他怕的不是华为的芯片跑分,怕的是模型开始围着华为的架构做优化。一旦全球开发者拿到的同一个模型,默认在非美系硬件上跑得更好,英伟达的优势就被一点一点啃掉了。
 
DeepSeek这次开源,刚好踩在这条线上。
 
当然,说CUDA明天就塌了那是胡扯。英伟达二十年的家底,七百万开发者,无数沉淀的库和工具,不可能一夜之间被搬空。DeepSeek的TileLang也不是CUDA的全面替代品,它只是把最底层那道墙凿开了一个口子。
 
但这个口子凿得够深。
 
那些真正在乎成本的团队,会开始算账。同样的模型,昇腾上跑得接近硬件上限,价格还便宜,为什么不试。试的人多了,生态就慢慢长起来了。
 
华为那边也没闲着。昇腾的CANN软件栈一直在开源,PTO虚拟指令集开放了一百二十多条指令,万卡算力集群给开发者用。DeepSeek这套工具链扔进去,等于往火堆里添了把干柴。
 
这事最有意思的地方不在于技术参数。在于姿态。
 
DeepSeek没有藏着掖着,没有搞什么“内部适配、商业合作”。直接开源,全世界都能下载,谁想用谁用。这种打法,摆明了是冲着建生态去的。你英伟达的墙再高,我直接把梯子发到每个人手里。
 
老黄当年说“灾难性结果”的时候,可能还觉得这事离得远。现在梯子已经架在墙边了。
 
信息来源:证券时报 2026年9月30日《DeepSeek开源昇腾基础组件》