NeurIPS 2026|LLM长文本推理加速
1️⃣ 一句话结论
让长文本LLM的Prefill提速2.1倍,不挑模型架构,直接塞进vLLM里跑。现有方法如MInference、FlexPrefill虽能在纯全注意力模型上跑出10倍加速,但遇到Qwen3-Next(线性/全注意力混合)、Gemma-3(滑动窗口/全注意力混合)就彻底"哑火"——全注意力层占比太低,加速被稀释到1.1倍以下。更致命的是它们不支持连续批处理,没法接入vLLM生产环境。
UniPrefill的破局点:不在注意力矩阵里做稀疏,直接在token层面裁剪——把不重要的token丢掉,让后续所有层都算得更少。
2️⃣ 背景痛点
我们做大模型落地,经常遇到"论文很美好,工程跑不动":
❌ 架构绑定:稀疏注意力深度耦合全注意力操作,混合架构里加速效果被稀释
❌ 系统隔离:按单请求处理,与vLLM动态连续批处理"说不到一块去"
❌ 只加速attention,不加速FFN:FFN的GEMM开销一点没减
三步走:
1)Token重要性估计:用最后n=128个query token与所有key算attention score,按块(G=64)聚合
2)Top-p筛选:保留累计重要性达p=0.99的最小token集合,自适应调整保留比例,理论保证最多丢弃1% attention mass
3)稀疏性跨层传播:一次drop决策,影响后续所有层的计算量。FLOPs节省量随序列长度N增长而放大,越长文本优势越明显
4️⃣ 怎么做到的
1)融合Kernel流水线:QK计算→online softmax→块级聚合→Top-p排序全在GPU完成,零CPU往返
2)Block Table动态更新:token被drop后实时更新vLLM的KV Cache映射,Decode阶段每层看到的KV长度与实际写入一致
3)Tensor Parallel同步:多卡场景下all-reduce聚合分数后统一drop决策
5️⃣ 我的思考
✅ 范式转移:从"注意力稀疏"到"token稀疏",天然适配任何架构
✅ 工程闭环:完整实现vLLM集成,学术圈不多见
⚠️ NPU适配:论文基于GPU,国内昇腾生态的融合kernel移植成本不低
⚠️ 与Prefix Cache兼容性:两者结合需仔细处理slot映射
大模型推理








