16张英伟达才跑得动的模型,8张AMD装下了
01. 一台机器装不下,就得两台
Wafer AI 这两天做了件事:把 Kimi K3 这个 2.8 万亿参数的大家伙,塞进了一台装 8 张 AMD 卡的服务器。同样的模型跑在英伟达 B200 上,得占两台机器、16 张卡。原因很朴素——这个模型光权重就要 1.5 TB 显存,B200 每张卡 192 GB,8 张凑起来刚好 1.5 TB,模型勉强放下就没地方了;AMD 那张卡每个 288 GB,8 张有 2.3 TB,一台机器就装完了。
02. 跨了两台机器,快卡也变慢卡
这不只是省一台机器的事。模型被切在两台机器上,每吐出一个字,都得走网络对一次账。最后的成绩是:一台 8 卡 AMD 的吞吐量,是 16 张 B200 折算到单台机器的 3.8 倍。
更扎心的是租金账——按 AMD 每卡每小时 2.5 美元、B200 4.25 美元算,同样花一美元,AMD 能买到 48 个字每秒的吞吐,B200 只有 7 个。
我得说句公道话,英伟达最新的 B300 绝对速度还是第一,没被超过。但论花的每一分钱换回多少活,这次它不是最优解。
03. AMD 最大的短板,这次只花了两个补丁
AMD 数据中心卡这些年被人诟病的从来不是硬件,是软件难伺候,模型搬过去要改框架、补代码,折腾几个月。
这次只卡了两处:一处是缺一个函数,工程师用普通代码补上了;另一处是模型每张卡分到 12 个注意力单元,而 AMD 那个高速模块只认 4、8、16 的倍数,于是他们把 12 补零凑成 16,算完再把多的扔掉。就这么个土办法,用户等第一个字出现的时间缩短了两三倍。
我的结论是,英伟达的护城河没塌,但缺口出现了,而且捅开它的不是更强的算力,是更大的显存。
我敢说明年会有一批数据中心真金白银去买 AMD,理由跟技术无关,就是同样的钱能多跑活。
AI AMD 英伟达