英伟达刚刚用4-bit这种以前被视为“傻子”的低精度,成功预训练出了一个120亿参数的大模型,而且整整吞下了10万亿Token。
在AI界,4-bit精度过去一直被判了死刑。大家都认为它只配在推理阶段省省电,如果敢在训练阶段用,极窄的动态范围会让梯度瞬间暴走,模型还没学会说话就直接崩成乱码。
所以从 OpenAI 到 Google,所有顶级实验室都坚信:预训练大模型,8-bit(FP8)已经是安全的底线。
英伟达这次不仅砸碎了这个禁忌,还完成了一场 publicly 记录中最长的4-bit训练长跑。
他们研发了一套名为 NVFP4 的新格式,用了三招极其精妙的数学组合拳:先用微块双层缩放给局部数据单独调教,再用随机阿达玛变换把那些容易引起暴走的离群异常值强制“打平”,最后加上随机舍入来保持梯度的纯净。
这台120亿参数的“怪兽”模型在10万亿Token的马拉松中全程稳如泰山,最终的损失函数曲线和下游任务精度,竟然与FP8格式训练出来的模型完全重合。
这意味着什么?
显存占用直接腰斩,算力吞吐量几何级暴涨。过去需要数万张顶级显卡、耗费数亿美元才能玩的万亿Token预训练游戏,硬件门槛被硬生生砍掉了一半。
过去几年,整个科技界都在靠蛮力堆叠集群,把算力挤压成了万亿巨头的专属游戏。英伟达却用这项技术证明了:我们甚至不需要突破物理极限,光是把数学精度的水分挤干,算力效率就能翻倍。
最讽刺的是,这看似是英伟达在“砸自己的显卡饭碗”,实则是给老黄的刀法盖上了终极印章。当预训练的门槛降低一半,原本被拒之门外的千行百业都会挤进来自研模型,显卡的缺口反而会更加暴增。老黄的名言“买得越多省得越多”终于进化成了“精度越低,买得越多”。
当所有人都在焦虑AI发展的 Scaling Law 是不是要撞墙时,英伟达用10万亿Token告诉世界:撞墙的不是AI,只是人类过去对算力的铺张浪费。
