【DFlash 2:让大模型推理从“逐字蹦”转向“并行猜”】Inco AI发布的DFlash 2通过并行草案模型将大模型推理速度提升了近3倍,且输出结果与原模型完全一致。它放弃了传统投机采样中草案模型仍需逐个生成Token的低效方式,转而采用全并行预测。核心改进在于引入了一个轻量级的路径选择器和动态卷积模块,前者负责从候选池中选出最连贯的路径,后者解决了预测序列末端准确率掉速的问题。目前该技术已适配vLLM、SGLang和llama.cpp,并为Qwen3.8-27B等模型提供了官方支持。推理成本是智能体时代的生死线,而投机采样是目前压榨GPU性能最有效的路径。DFlash 2的思路很聪明:既然预测下一个Token很难,那就在并行预测出的多个候选者中做“连贯性选择”,因为选择的计算开销远低于预测。这种架构避开了增加模型深度带来的延迟,用极小的参数代价换取了显著的吞吐量提升。它给开发者的启示是,推理优化不一定非要死磕模型规模,改变Token的生成逻辑往往能带来更直接的效率红利。在一个智能体需要消耗海量Token的未来,这种极致的推理经济学将决定谁能留在牌桌上。


