DC娱乐网

NVIDIA&陈天奇团队:Cake 打破 GPU内核瓶颈

💥 当 Coding Agent 遇上 GPU 编程,黑盒优化的时代终于要被终结了!

这篇论文来自 NVIDIA 与 CMU(卡耐基梅隆大学)联合团队,提出了全新的 “编译器-Agent 协同设计”(Compiler–Agent Co-Design) 框架——Cake。

- Cake IR:让 Agent 直接描述 warp 分工、内存搬运、Barrier 和 Pipeline 等硬件调度,同时省去复杂的 layout algebra。
- 结构化反馈:编译前检查同步、资源、数据流和硬件约束,并返回定位到具体角色、资源或阶段的诊断。
- 编译器进化:反复出现的失败会被沉淀为新的验证规则、IR 原语、成本模型校准或优化策略。
- 从单点到库:先针对一个 shape 找到强实现,再通过 Dispatcher 扩展成覆盖完整输入域的内核组合。

在 B200 上,同样使用 GPT-5.6-sol、每组3次、8000万 Token 的 Flash-KMeans 冷启动实验中,Cake IR 的最佳候选中位数达到调优后 FlashML 基线的 1.144×,直接编写 CUDA/PTX 为 0.928×。

Agent 生成的 Kimi Delta Attention Prefill 对官方 FlashKDA 实现取得 2.05× 几何平均加速;KNN、KMeans 的 Dispatcher 版本则在400多个形状上达到 1.42×–2.12×。

真正值得关注的不是又多了一门 GPU DSL,而是 CAKE 把“编译器知道、Agent 不知道”的信息变成了可检查、可反馈、可积累的工程知识。

推荐做 GPU Kernel、推理系统、编译器和 Coding Agent 的同学可以读一下,给大家上传到附件了,自取[害羞R]

#NVIDIA #CAKE #GPUKernel #AI编译器 #CodingAgent #CUDA #推理优化