AI慢的原因不是计算,而是内存
引擎越来越大,但燃料软管没变粗,这就是内存墙
NVIDIA在让软管变粗,
特斯拉则是提前把材料放到砧板上
方式不同
内存就看这3种就行
SRAM = 芯片内的砧板。最快但贵且小
HBM = 芯片旁的高级传送带。超级宽但贵,装车难
LPDDR/GDDR = 大型普通仓库。速度慢点但便宜,容量好拉
Dojo不是车芯片,是用于训练的
D1每个核心SRAM 1.25MB作为主内存。不是缓存
芯片整体SRAM约440MB,瓦片(25芯片)约11GB
HBM不是直接附在芯片上,而是旁边的DIP卡作为仓库
工作用SRAM,下一个数据才用HBM
适合视觉训练,但像巨型LLM那样把整个模型放一芯片的任务,从一开始就有容量不足的指摘
车·机器人芯片不使用HBM
不是性能不足,而是成本·发热·车认证原因
HW3: LPDDR4,约68GB/s。每个NPU SRAM 32MB。后来废弃的原因也不是计算,而是带宽。HW4的约1/8。
HW4: GDDR6,系统约384GB/s。每个SoC约16GB。塞进多台相机后,比起计算,数据供应先卡住,所以故意提升带宽。
AI5是今年4月出了封装照片
中间计算die,左右SK海力士内存12个。LPDDR5X马斯克标准下,比AI4计算8倍,容量9倍,带宽5倍。容量144~192GB,带宽0.9~1.5TB/s估计。不是HBM。在车芯片上塞入服务器级LPDDR。
量产是2027年前后,先去的地方是Optimus·内部集群。
AI6方向更明确。
LPDDR6。加速器面积近一半分配给SRAM。SRAM上的计算,有效带宽比DRAM约10倍。
是否放HBM,2025年说“还没决定”
经常用的参数少的话,比起贵的HBM,便宜的大仓库 + 片上SRAM可能更好,这个逻辑
NVIDIA的房子是HBM。
H100 80GB / 3.35TB/s
H200 141GB / 4.8TB/s
B200 192GB / 8TB/s
片上L2是50~126MB。模型一直留在HBM到最后
让任何模型都能跑,但每个token都要重新刮仓库。
巨型LLM训练·大批次还是HBM合适。特斯拉训练也继续买NVIDIA
车·机器人实时推理是批次1,电力·成本·认证优先,所以LPDDR能理解
但是LPDDR带宽是HBM的1/3~1/8
模型每次扫完整权重又成墙
量化·蒸馏·激活参数一起削减,AI5选择才成立。
数字比起“抓住NVIDIA”
“试图从结构上降低自己推理成本”更准确