DC娱乐网

算力网络的老病根,终于有人动了。 AI推理有个老问题:Prefill(预填充)和

算力网络的老病根,终于有人动了。
AI推理有个老问题:Prefill(预填充)和Decode(解码)这两个阶段对算力需求完全不同,硬绑在一台机器上,两边都跑不快。行业管这个叫PD分离——道理都对,但真要拆开的时候,网络传输的延迟又把优势吃掉了。
无问芯穹在2026 WAIC世界人工智能大会上拿出了一个叫PDD的架构。他们把传统的"P-D"两级解构成了"P-RLD-MD"三级——核心思路是用广域以太网把多个数据中心串起来,让偏科的硬件只刷自己擅长的活。
效果是:首Token延迟降了51.5%,成本降了37.5%。
两个数字放在一起看才有意思。延迟砍半意味着用户体验的真实改善——不管你用哪个AI产品,第一个字蹦出来的速度能快一倍。成本降了近四成,说明分布式算力调度这条路确实能跑通。
当下大家都在追单机性能、挤芯片,但事实上国内已经建成的大量数据中心利用率并不高。PD分离破了这个局,意义可能比又追一个百分点的模型跑分更大——让存量的东西先动起来。
AI算力 PD分离 无问芯穹