DC娱乐网

中科曙光展台蹲了一下午,这个“词元加速”方案我看懂了 贵阳数博会第二天,中科曙光

中科曙光展台蹲了一下午,这个“词元加速”方案我看懂了
贵阳数博会第二天,中科曙光展台人挤人,碰巧今天他们刚发布了个ParaCache词元加速方案,都是来咨询了解的,热度非常高。

很多人会问,大模型推理为啥越来越慢?因为每生成一个字,都得把前面所有内容重新算一遍,跟得了“健忘症”一样。中科曙光这方案就干了一件事:把算过的结果存起来,下次直接用。现场工作人员说,120K长文本输入,首Token时延从几十秒压到400毫秒,降了98.5%。

更狠的是高并发场景,Token吞吐量直接拉高27倍,同样的GPU投入,产出翻着跟头涨。有同行在旁边嘀咕:这要是铺开了,API调用费不得打下来一大截?

我特意问了下技术细节,他们搞了个四级缓存池,热门的放显存,温的放内存,冷的往SSD和分布式存储里搁,这样不用啥都往昂贵的HBM里塞,硬件成本压下来不少。据说已经在那台十万卡的曙光8000上验证过了,这回大模型推理的“内存墙”,感觉真要被凿穿了。

中科曙光ParaCache 中科曙光发布新一代词元加速方案 数博会2026