DC娱乐网

一个 30B 总参数的 MoE 模型,跑起来只激活 3B,NVIDIA 把这种"

一个 30B 总参数的 MoE 模型,跑起来只激活 3B,NVIDIA 把这种"听起来很分裂"的配置做成了开源——Nemotron 3.5 Lightning,目标直接对准 always-on 智能体。官方给出的数字是:输出速度最高达到同类规模模型的 4 倍,对比 Qwen3.6 35B 快 35%,同时性能保持相当。权重已经放到 HuggingFace 上,可以直接拉下来测。

对常驻 agent 来说,这种结构的核心诱惑是账单:推理时实际算力开销接近 3B 稠密模型,长跑高并发场景下的硬件和电费成本结构会友好很多,不用为了偶尔的复杂任务把整张 30B 的卡一直烧着。换句话说,它把"小模型跑得起"和"大模型兜得住"这两件事压在了同一套权重里。

但落地那一步并不轻松。30B MoE 的总容量意味着权重文件本身不小,显存门槛和推理框架的兼容度才是真正的拦路虎——激活参数再小,也得先把这 30B 装得下、调得动。NVIDIA 强调的"4 倍速度"和"比 Qwen3.6 35B 快 35%",目前都没有公开具体的对标清单、batch 大小、量化方式和硬件前提,速度优势能不能在你的栈里复现,还得自己跑一遍才知道。

所以对正在选型的团队来说,这更像是一次有诚意的实验邀请:低成本激活的成本结构值得测,但 3B 激活的智商会不会在专业任务上掉档、MoE 的部署复杂度会不会吞掉那部分省下的钱,都需要先用真实流量验证一遍,再决定是不是把它放进生产链路。

如果把它接到你的 agent 流水线里,你更担心 3B 激活的智商掉档,还是 30B MoE 的部署复杂度?