DC娱乐网

Qwen 把总参数推到 2.4T、激活 95B,塞进 69 层 GDN 线性注意

Qwen 把总参数推到 2.4T、激活 95B,塞进 69 层 GDN 线性注意力和 23 层 GQA 的 3:1 交错,首日就要稳跑吞吐——这套混合架构让传统全注意力的所有假设失效,却仍敢做 Day-0 上线。SGLang 和 Miles 这次踩中的不是单点算力,而是有状态难题:GDN 状态得在 decode 时被复现,Prefill 和 Decode 必须分桶,RadixCache、HiCache、并切分被迫重写假设,才能把有状态的混合注意力塞进通用推理栈。

数字层面,他们交出的成绩单相当具体:NVFP4 检查点在 TP8 B300 上 batch 1 解码 346 tok/s,配 MTP 接受长度 3.3,换 DSpark 378 tok/s、接受长度 4;PD 解耦下 8K/1K 冲到 5,126 tok/s per GPU。

同一批 B300 上,BF16 Megatron 训练器和 NVFP4 SGLang rollout 引擎共享 64 卡,GSM8K GRPO 验证奖励和 KL 都跑得稳,Day-0 RL 链路首跑即通。

把判断框住:SGLang 的真正底气来自 ReplaySSM 加分阶段并行对 serving 栈的重构,而非单纯硬件红利;NVFP4 精度代价、PD 解耦部署门槛、B300 集群 RL 稳定性,在通用推理栈里仍待反复踩。你们最关心 Qwen3.8 落地时的哪一个环节:NVFP4 精度代价、PD 解耦部署门槛,还是 B300 集群 RL 训练稳定性?