我们为什么会做 dLLM,又能否取代 AR?
过去一年,diffusion language model(dLLM)快速升温。Google 发布了 DiffusionGemma,LLaDA 系列推进到了 2.2,黄高老师团队的 The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models也获得了 ICML Outstanding Paper。离散扩散语言模型已经从一个相对小众的研究方向,逐渐进入主流模型的讨论范围。
但一个始终没有消失的问题是:dLLM 能取代 autoregressive language model(AR)吗? 如果“取代”并不是一个恰当的问题,那么在未来的模型生态中,dLLM 又可能占据怎样的位置?
本文主要讨论 masked、blockwise 的离散扩散语言模型,不包含 ELF 等连续扩散或 latent diffusion 方案。
这个边界很重要。目前许多有竞争力的 dLLM 都是从 AR checkpoint 改造而来,并在推理时采用 block diffusion。后文关于逐位置边际预测、并行提交和联合一致性的分析,主要针对这一类模型,不能不加区别地推广到所有 diffusion 方案。
连续 diffusion 是否具有相同的问题,仍然需要单独讨论。
青稞社区 大模型 dLLM 人工智能 LLM














