DC娱乐网

AI慢的原因不是计算,而是内存 引擎越来越大,但燃料软管没变粗,这就是内存墙 NVIDIA在让软管变粗, 特斯拉则是提前把材料放到砧板上 方式不同 内存就看这3种就行 SRAM = 芯片内的砧板。最快但贵且小 HBM = 芯片旁的高级传送带。超级宽但贵,装车难 LPDDR/GDDR = 大型普通仓库。速度慢点但便 ​

AI慢的原因不是计算,而是内存

引擎越来越大,但燃料软管没变粗,这就是内存墙

NVIDIA在让软管变粗,

特斯拉则是提前把材料放到砧板上

方式不同

内存就看这3种就行

SRAM = 芯片内的砧板。最快但贵且小

HBM = 芯片旁的高级传送带。超级宽但贵,装车难

LPDDR/GDDR = 大型普通仓库。速度慢点但便宜,容量好拉

Dojo不是车芯片,是用于训练的

D1每个核心SRAM 1.25MB作为主内存。不是缓存

芯片整体SRAM约440MB,瓦片(25芯片)约11GB

HBM不是直接附在芯片上,而是旁边的DIP卡作为仓库

工作用SRAM,下一个数据才用HBM

适合视觉训练,但像巨型LLM那样把整个模型放一芯片的任务,从一开始就有容量不足的指摘

车·机器人芯片不使用HBM

不是性能不足,而是成本·发热·车认证原因

HW3: LPDDR4,约68GB/s。每个NPU SRAM 32MB。后来废弃的原因也不是计算,而是带宽。HW4的约1/8。

HW4: GDDR6,系统约384GB/s。每个SoC约16GB。塞进多台相机后,比起计算,数据供应先卡住,所以故意提升带宽。

AI5是今年4月出了封装照片

中间计算die,左右SK海力士内存12个。LPDDR5X马斯克标准下,比AI4计算8倍,容量9倍,带宽5倍。容量144~192GB,带宽0.9~1.5TB/s估计。不是HBM。在车芯片上塞入服务器级LPDDR。

量产是2027年前后,先去的地方是Optimus·内部集群。

AI6方向更明确。

LPDDR6。加速器面积近一半分配给SRAM。SRAM上的计算,有效带宽比DRAM约10倍。

是否放HBM,2025年说“还没决定”

经常用的参数少的话,比起贵的HBM,便宜的大仓库 + 片上SRAM可能更好,这个逻辑

NVIDIA的房子是HBM。

H100 80GB / 3.35TB/s

H200 141GB / 4.8TB/s

B200 192GB / 8TB/s

片上L2是50~126MB。模型一直留在HBM到最后

让任何模型都能跑,但每个token都要重新刮仓库。

巨型LLM训练·大批次还是HBM合适。特斯拉训练也继续买NVIDIA

车·机器人实时推理是批次1,电力·成本·认证优先,所以LPDDR能理解

但是LPDDR带宽是HBM的1/3~1/8

模型每次扫完整权重又成墙

量化·蒸馏·激活参数一起削减,AI5选择才成立。

数字比起“抓住NVIDIA”

“试图从结构上降低自己推理成本”更准确