DC娱乐网

英伟达最硬核的护城河,本质上根本不是显卡硬件本身,而是全球能把低层 CUDA 代

英伟达最硬核的护城河,本质上根本不是显卡硬件本身,而是全球能把低层 CUDA 代码优化到极致的顶尖工程师,加起来都不够塞满半个会议室。

现在,这条全行业昂贵无比的手艺人壁垒,正被无限并发的 AI 智能体平推。

清华大学 AIR 研究院与字节跳动 Seed 团队联合发布了一项重磅成果:CUDA Agent。

这不是那种只会在聊天框里吐出两行 BUG 代码的传统大模型,而是一个基于大规模强化学习(Agentic RL)的 GPU 内核自动生成与调优智能体。

以前,想要榨干一块 GPU 的最后一滴性能,极其依赖手艺人级别的硬件专家。

你得像做微雕一样,小心翼翼地调度并行线程、管理共享内存、避开访存冲突。普通大模型在这类硬核底层代码面前几乎一碰就碎,性能远远落后于传统的编译器系统。

但这次清华和字节团队换了个降维打击的思路。他们没有让 AI 去死记硬背代码范式,而是构建了一个包含自动化硬件验证、性能分析(Profiling)与合成数据管道的闭环测试环境。

简单来说,他们把 GPU 的微架构当成了一个无限试错的“围棋棋盘”,让智能体在真实的硬件物理约束下自我博弈。通过海量的强化学习,模型自己“悟”出了如何写出高并发、高吞吐的顶级 GPU 代码。

跑分数据只能用残暴来形容。在权威基准测试 KernelBench 上,CUDA Agent 在 Level-1、Level-2 和 Level-3 三个难度层级中,代码执行速度相比 PyTorch 的官方编译器 torch.compile,直接跑出了 100%、100% 和 92% 的碾压级优势。

更绝的是,在最折磨人的 Level-3 顶峰对决中,它面对硅谷最顶尖的闭源巨兽 Claude Opus 4.5 和 Gemini 3 Pro,性能依旧领先了约 40%。

这背后的行业影响极其深刻。老黄掌控 AI 时代的双杀武器,左手是性能强悍的芯片,右手就是深不可测的 CUDA 软件生态。这套生态之所以难翻,是因为其他芯片厂商根本凑不出那么多顶级工程师去写极致优化的算子,软硬件适配成本高得吓人。

如果一个开源智能体系统,能够以近乎零成本的方式自动摸透硬件物理架构、自动探索极致并行路径、自动重写生产级的底层代码,CUDA 昂贵的人力锁头效应就开始加速蒸发了。

当算法智能体开始掌握“替硬件重写灵魂”的能力,硬件芯片的算力经济学将被彻底重构。曾经靠养着一群“硬件巫师”筑起的技术天堑,正在被无限并发的自我进化撕开巨大的缺口。接下来,压力完全来到了硅谷编译器团队这一边。