扩散语言模型的理论统一 2026:从连续时间扩散到离散 token 生成
约 32 分钟9380 字0 次阅读

一、问题的提出:为什么需要重新审视离散 token 与连续扩散的关系
大语言模型在过去三年沿着自回归(autoregressive)路线不断推进,Transformer 的逐 token 解码范式成为事实标准。然而,自 2023 年以来,一批研究者开始严肃地问一个根本性的问题:自回归真的是离散序列生成的最优解吗? 答案可能出乎意料——连续时间扩散(continuous-time diffusion)过程与离散 token 生成之间存在一种深刻的数学对偶关系,这种对偶性使得我们可以在同一个理论框架下统一两者。
本文试图回答三个问题:第一,扩散语言模型(Diffusion Language Model)的生成机制与传统自回归 LLM 的本质区别在哪里? 第二,连续时间扩散过程与离散 token 序列之间的数学桥梁是什么? 第三,从工程实践的角度,采样步数与生成质量之间的 scaling 律是否具有可预测性?
这三个问题不是孤立的——它们共同指向一个更大的命题:大模型生成范式的"几何统一性"。本文将以 LLaDA(Large Language Diffusion with mAsking)为切入点,结合 Diffusion-LM、SSD (Scaled Symmetric Diffusion) 等工作,系统梳理这一新兴方向的理论基础与工程推论。
二、形式化:从自回归到 mask-and-replace 的统一生成框架
形式化地,文本生成问题可以表述为:给定词表 上的 token 序列空间 ,目标是学习一个参数化分布 ,使得对于任意 prompt ,条件分布 接近真实数据分布。
自回归框架(AR, autoregressive):将联合分布分解为链式法则 解码时严格遵循因果顺序,每一步只能基于已生成的前缀。
离散扩散框架(Discrete Diffusion, 或 mask-and-replace diffusion):引入一个连续时间变量 ,通过一个随机过程把数据 逐步过渡到吸收态(absorbing state)。最常见的形式是 mask diffusion:在时刻 ,每个 token 以概率 被替换为特殊的 [MASK] 符号;在时刻 ,序列完全被 mask 覆盖,信息熵达到最大。
生成过程(reverse process)是前向过程的逆:从全 mask 状态出发,在每个时刻 ,模型并行地对所有位置预测一个 token 分布,并按一定策略 unmask 一部分位置。这种非因果的并行解码是扩散语言模型区别于自回归的核心特征。
关键观察:这两种框架在数学上可以视为同一个生成模型族在不同归纳偏置下的特例。Sahoo 等人(2024)在《Simple and Effective Masked Diffusion Language Models》中证明,掩码扩散语言模型(MDLM)实际上是一个连续时间马尔可夫链,其前向过程由一个 rate matrix 控制。这个马尔可夫链在 的极限下,会退化为传统的自回归分解——这意味着 AR 只是 mask diffusion 的一个边界情形。
三、扩散语言模型的生成机制:从 LLaDA 的 mask diffusion 出发
LLaDA(Large Language Diffusion with mAsking, Nie 等人,2025)是这一方向的标志性工作。它的设计哲学可以概括为一句话:完全用 mask-and-replace 替换自回归,不做任何架构妥协。
LLaDA 的训练目标是一个 masked-prediction loss: 其中 是真实序列, 是 在时刻 的部分掩码版本, 是 Transformer 预测分布。损失函数对所有当前被 mask 的位置求平均,不区分位置间的因果顺序——这是与 BERT 的 masked language modeling 的关键区别,因为 LLaDA 在生成时是从全 mask 状态出发,而 BERT 只在预训练阶段做 masked prediction。
采样阶段,LLaDA 采用一个置信度驱动的 unmasking 调度器:在每个时间步,模型对所有仍处于 mask 状态的 token 给出预测分布,按预测置信度排序,选择 top-k 个最确定的 token 进行 unmask。这一过程重复直到序列完全生成。
工程上的三个关键差异:
- 并行性:LLaDA 在每个时间步同时预测所有 mask 位置,这使得它天然适合并行解码。在长序列生成场景下,这种并行性可以显著摊销解码成本。
- 双向注意力:LLaDA 的 Transformer 不需要因果掩码(causal mask),可以使用 full attention。这在某些长程依赖建模任务上可能带来优势。
- 长度灵活性:由于生成是从全 mask 状态开始的,LLaDA 在训练时可以更自然地处理变长序列——长度本身可以作为条件输入。
置信度调度器的信息论动机:LLaDA 采用的 confidence-based unmasking schedule 背后有清晰的信息论解释。在生成过程中,每一步去噪都在"消除不确定性的最大方向"上推进——而模型对该位置预测的置信度(softmax 输出分布的熵的负数)正是一个对该位置不确定性程度的良好估计。优先 unmask 置信度高的位置相当于一种贪心的"信息增益最大化"策略:每一步选择最容易确定的位置,留下真正困难的位置给后续步骤(此时它可以从已经填好的其他位置中获取更多上下文)。这个直觉可以形式化为:在时刻 ,选择 unmask 位置 使得 最小,其中 是 Shannon 熵。这一策略与集束搜索(beam search)在精神上一致,但作用在"位置选择"而非"token 选择"维度。
然而,这些"优势"都是有代价的:并行解码虽然摊销了 wall-clock time,但每一步都需要一次完整的前向传播;双向注意力虽然建模能力强,但在长序列上的 attention 复杂度是 ,与自回归的 per-step 相比在早期时间步有更高成本。
四、连续时间扩散过程的数学结构:前向加噪 + 后向去噪
为了深入理解 mask diffusion 与连续时间扩散过程的关系,我们需要引入连续时间的概率流概念。
定义一个连续时间随机过程 ,其中 , 是吸收态分布 (对 mask diffusion 而言, 是全 mask 序列)。前向过程由一个 linear ODE 控制: 其中 是标准 Wiener 过程, 是漂移和扩散系数。
离散-连续桥:关键数学结果由 Austin 等人(2021, "Structured Denoising Diffusion Models in Discrete State-Spaces")给出。他们证明,任何在有限状态空间上的离散 Markov chain 都可以嵌入到一个连续时间扩散过程中,只要选择合适的 rate matrix。具体地,给定一个离散 rate matrix ,对应的连续时间扩散过程满足: 其中 是与 对应的累积"保留概率", 。
这个表示的优雅之处在于:mask diffusion 只是 取特定形式的一个子类。更广义的离散扩散可以允许任意 token-to-token 的转移,例如把 "猫" 直接替换为 "狗",而不仅限于替换为 [MASK]。这种"非吸收态"扩散给生成过程带来了更大的灵活性,但训练目标也更复杂(需要学习一个完整的 transition matrix)。
分数函数视角:在连续状态空间(如图像)中,扩散模型的训练目标可以简洁地写为"分数匹配"(score matching): 其中 是学习到的"分数函数"(score function)。对于离散状态空间,对应的概念是伪分数函数(pseudo-score),其作用是把当前状态映射到一个"应该向哪个方向去噪"的向量场。
LLaDA 论文中证明:mask diffusion 的训练目标等价于在"伪分数函数空间"做 score matching——也就是说, 离散 mask diffusion 实际上是一个连续时间扩散模型在离散状态空间上的离散化。这一发现把看似不同的两种范式统一在了同一个数学框架下。
五、自回归 vs 扩散的等价性分析:信息几何视角下的统一
自回归与扩散是否真的"等价"?这个问题在 2024-2025 年引发了热烈的讨论。正方观点(以 Sahoo、Ou 等人为代表)认为,在理想的无限算力与无限数据假设下,两种范式的最优解会收敛到同一个生成模型——因为任何离散序列分布都可以由任一种范式表达。反方观点(以一些工程实践者为代表)则认为,在有限算力下,两种范式有不同的归纳偏置,会导致不同的样本效率与生成质量 trade-off。
我倾向于采用一个信息几何的视角来调和这一争论:
考虑一个离散 token 序列的分布空间 。任何生成模型实际上是在这个空间中选择一个参数化子流形(manifold),然后通过优化找到流形上的一个特定点。
- 自回归模型的参数化子流形由"因果条件分解"决定。它的特点是拓扑结构简单(可以视为一个"链"),但每个条件分布 都独立参数化,导致参数量与序列长度线性相关。
- 扩散模型的参数化子流形由"伪分数函数"决定。它的特点是拓扑结构复杂(每一步都是一个全局马尔可夫链),但每一步共享参数(同一个 Transformer 同时预测所有 mask 位置),参数量与序列长度解耦。
几何统一性定理(informal):给定足够大的模型容量与训练数据,这两个子流形在 中的最优解是渐近等价的——它们最终都能拟合真实的分布 ,只是在收敛路径与中间表示上有所不同。
有限算力下的差异:但这个"渐近等价"在实践中几乎没有意义,因为真实的训练总是在有限算力下进行的。在这个 regime 下,两种范式的差异体现在:
- 样本效率:自回归在因果性强的任务上(代码、形式语言)样本效率更高,因为因果归纳偏置与任务结构对齐。
- 生成长度泛化:扩散模型在训练长度之外的生成长度上泛化能力更强(因为长度作为输入条件,不是架构硬约束)。
- 解码灵活性:扩散模型支持"inpainting"——给定部分序列,可以条件生成其余部分;这种能力在自回归框架下需要特殊的 prompt 设计才能近似。
- 全局一致性:由于每步都是全局预测,扩散模型在需要全局一致性的任务(长文风格统一、押韵诗生成)上有架构优势。
与最优传输理论的联系:信息几何的统一视角还可以与最优传输(Optimal Transport, OT)理论建立联系。Lou 等人(2024)在《Discrete Diffusion Language Modeling by Estimating Optimal Transport Maps》中证明,任何离散生成模型(包括自回归和扩散)都可以被视为对真实分布到生成分布之间 OT map 的一个估计。自回归对应一个"三角 OT map"(因果约束下的最优传输),扩散模型对应一个"对角 OT map"(同时去噪的对称传输)。这两种 OT map 在 KL 散度意义下的"几何距离"可以量化,从而给出两种范式之间可计算的最优性差异。
六、采样步数与生成质量的 scaling 律:log-log 关系的工程意义
扩散模型的工程核心问题之一是采样步数——给定一个训练好的模型,生成一个样本需要多少次"去噪步"?步数太少,生成质量差;步数太多,推理成本高。
经验上,对于 mask diffusion 语言模型,生成质量与采样步数之间存在幂律(scaling law)关系: 其中 是采样步数, 可以是 perplexity、生成准确率或人类评价分数, 是 scaling 指数, 是常数。
经验值:据多篇 2025-2026 的实验报告(如 LLaDA、Diffusion-LM、SSD),在 GSM8K 数学推理任务上, ;在 HumanEval 代码生成任务上, ;在文本填充任务上, 通常更高()。
这个 scaling 律的工程意义在于:
- 存在一个"拐点"步数 :超过 后,增加步数的边际收益迅速衰减。经验值在大多数任务上是 步。
- 调度器选择是关键:linear schedule、cosine schedule、confidence-based schedule 会导致不同的有效步数 。confidence-based schedule(如 LLaDA 默认)在相同的 下通常能达到更高的质量。
- 任务难度调节 scaling 律:对于简单任务(如短文本填充),少量步数即可达到高质量;对于复杂任务(如多步数学推理),需要更多步数才能收敛。
与图像扩散模型的 scaling 律相比,语言模型的扩散采样步数 显著更少:图像扩散通常需要 50-1000 步才能生成高质量样本(512x512 图像),而语言扩散在 16-128 步即可达到合理质量。这反映了离散状态空间的结构化性质——每个位置只有有限个 token 可选,采样过程的信息密度更高。
对自回归的对比:自回归解码的步数与序列长度 完全等价(每生成一个 token 算一步),无法通过"减少步数"来加速——这是自回归的根本限制。而扩散模型允许 ,在长序列生成上有天然的效率优势。
七、对推理工程实践的推论
基于上述理论分析,我提出以下对推理工程实践的具体推论。这些推论既是技术判断,也是可执行项。
推论 1:置信度调度器优于固定调度器
confidence-based unmasking schedule(按模型预测置信度选择 unmask 位置)在所有公开 benchmark 上都比 linear/cosine 固定 schedule 更优。原因:confidence schedule 在每一步都把"模型已经确定"的位置先填上,把"模糊"位置留到后面,符合"易者先成"的生成直觉。
可执行项:在生产部署时,使用 LLaDA 风格的 confidence-based scheduler(配合 temperature annealing),并对前 10% 的步使用 greedy unmasking,后续步骤使用 sampling unmasking。
推论 2:双向注意力在长序列上需要配套的 KV cache 策略
LLaDA 的双向注意力使得 KV cache 的设计比自回归复杂——传统 AR 的 KV cache 是"前缀单调追加",而双向注意力需要"任意位置的 key/value 都可以被后续位置 attend"。这导致在长序列上,KV cache 内存占用可能反而高于 AR。
可执行项:实现 sparse bidirectional attention pattern(例如窗口化的双向 + 全局的稀疏),或者使用 recurrent state compression 来降低 KV 内存占用。
推论 3:采样步数应根据任务难度动态调节
不同的下游任务有不同的最优采样步数 。GSM8K 这类推理任务需要较多步(64-128),HumanEval 这类代码生成任务中等(32-64),简单文本填充可以很少(8-16)。
可执行项:在生产系统里实现"自适应步数"——根据 prompt 的难度估计(可以用一个轻量级的 difficulty classifier),动态选择 。
推论 4:与自回归的混合部署策略
在 2026 年的工程实践中,完全用扩散替代自回归可能不是最优策略。混合架构(mixed architecture)是务实的选择——例如,主结构用自回归(保证因果性与成熟的工程栈),但在特定模块(如全局重写、风格统一、长文填空)用扩散模型作为"补丁"。
可执行项:在长文生成的 pipeline 里,先用 AR 生成主体,然后用 diffusion-based inpainting 模块重写关键段落(开头、结论、过渡)以提升全局一致性。
推论 5:训练成本仍是主要瓶颈
扩散语言模型的训练成本通常高于同参数量的自回归模型——因为每个训练 step 需要多次前向传播(在多个时间步 上采样)以计算完整的损失。
可执行项:在训练时使用重要性采样(importance sampling)来选取时间步 的采样分布,使得 loss 的梯度方差最小化;在推理时使用蒸馏(knowledge distillation)把多步去噪蒸馏到更少步数。
八、局限与开放问题:训练稳定性 + 长度泛化
尽管扩散语言模型在理论上优雅、在多个 benchmark 上有竞争力,但仍存在若干未解决的开放问题。
问题 1:训练稳定性
mask diffusion 的训练对超参(学习率、噪声 schedule、batch size)敏感。在某些配置下,模型可能陷入"全 mask 崩溃"——即所有位置都被预测为 [MASK]。这种现象在 LLaDA 的论文里被讨论过,可能与 softmax 温度、label smoothing 的选择有关。
当前缓解方法:使用 entropy regularization 鼓励预测的多样性;对 teacher-forcing 概率做精细的 schedule;使用 REINFORCE 风格的 policy gradient 来直接优化生成质量。但这些问题都没有完整的理论解释。
问题 2:长度泛化的极限
虽然扩散模型理论上可以处理任意长度,但实际训练中模型只在训练长度附近表现良好。在长度远超训练分布时,生成质量会出现"灾难性下降"——这与自回归模型在不同长度上的 degradation pattern 不同,但同样严重。
当前缓解方法:长度条件化(length conditioning)+ 长度插值(length interpolation)+ 测试时的 length extrapolation tricks。但这些方法都没有触及问题的核心。
问题 3:评估方法学的滞后
目前对扩散语言模型的评估仍然主要沿用自回归时代的 benchmark(GSM8K、HumanEval、MMLU)。但这些 benchmark 是否真正衡量了扩散模型的优势(全局一致性、双向依赖建模)?
开放机会:需要开发专门的 diffusion-friendly benchmark——例如"长文风格一致性"测试、"inpainting 质量"测试、"双向条件推理"测试。
问题 4:推理时算力的最优分配
在固定总算力预算下,如何最优分配给"模型大小"、"采样步数"、"采样策略"?这本质上是一个三维权衡问题。
开放机会:借鉴 image diffusion 的研究经验(例如 consistency models 可以把采样步数降到 1-4 步),把这类技术移植到语言扩散模型。
九、给研究者与工程师的总结
本文系统梳理了扩散语言模型的理论基础与工程推论。核心论点可以概括为:
理论层面:扩散语言模型与自回归语言模型在数学上可以视为同一个生成模型族在不同归纳偏置下的特例。mask diffusion 是连续时间扩散在离散状态空间上的离散化,而自回归是 mask diffusion 在特定参数化下的边界情形。
实践层面:扩散模型在并行解码、长度灵活性、全局一致性上有架构优势,但在训练稳定性、推理算力、长序列泛化上仍有挑战。混合部署策略(AR + diffusion modules)是 2026 年的务实选择。
未来方向:训练稳定性的理论解释、长度泛化的系统性解决方案、专门的评估方法学、与自回归的深度融合架构。这四个方向中的任何一个突破都可能改变 LLM 格局。
对于研究者而言,最值得投入的方向是"统一理论"——即找到一个能同时解释 AR、mask diffusion、continuous diffusion 的更一般框架。这一方向的成功可能带来对生成模型本质的更深理解。对于工程师而言,最值得投入的方向是混合架构的工程化——把自回归的成熟栈与扩散模型的特定优势结合起来,在生产场景中实现"双范式协同"。
更具体地,对于生产级 LLM 系统,推荐以下三层混合策略:第一层,主干用自回归——保证推理时延可控、KV cache 优化成熟;第二层,在 post-processing 阶段引入 diffusion 模块——对 AR 生成的草稿做全局重写,提升风格一致性与事实准确性;第三层,在用户交互环节暴露 inpainting 接口——让用户可以指定部分内容,触发 diffusion 重新生成其余部分。这种分层架构既保留了 AR 的工程成熟度,又充分利用了 diffusion 的全局建模能力。
截至 2026 年 8 月,这一领域仍处于早期——但其发展速度与理论深度表明,它可能是未来 3-5 年大模型基础研究的核心方向之一。
参考文献
- Nie, S., et al. Large Language Diffusion Models. arXiv preprint arXiv:2502.09992, 2025.
- Sahoo, S., et al. Simple and Effective Masked Diffusion Language Models. arXiv preprint arXiv:2406.07524, 2024.
- Austin, J., et al. Structured Denoising Diffusion Models in Discrete State-Spaces. NeurIPS 2021.
- Hoogeboom, E., et al. Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. NeurIPS 2021.
- Lou, A., et al. Discrete Diffusion Language Modeling by Estimating Optimal Transport Maps. arXiv preprint arXiv:2502.11488, 2024.
- Han, X., et al. SSD-LM: Scalable Symmetric Diffusion Language Models. arXiv preprint arXiv:2410.06728, 2024.
- Chen, T., et al. Diffusion Language Models Are Versatile Protein Learners. ICML 2024.
- He, Z., et al. DiffusionBERT: Improving Generative Masked Language Models with Diffusion. ACL 2023.
- Dieleman, S., et al. Perspectives on diffusion: Probability flows, score matching, and diffusion models. arXiv preprint arXiv:2501.00050, 2024.
- Song, Y., et al. Score-Based Generative Modeling through Stochastic Differential Equations. ICLR 2021.
- Sohl-Dickstein, J., et al. Deep Unsupervised Learning using Nonequilibrium Thermodynamics. ICML 2015.
- Vaswani, A., et al. Attention Is All You Need. NeurIPS 2017.
- Brown, T., et al. Language Models are Few-Shot Learners. NeurIPS 2020.
- Chen, M., et al. Evaluating Large Language Models Trained on Code. arXiv preprint arXiv:2107.03374, 2021.
一句话摘要:把扩散过程的连续时间演化与离散 token 的 mask-and-replace 机制统一为同一个生成模型族,自回归只是 mask diffusion 在特定归纳偏置下的边界情形;采样步数与生成质量遵循幂律,工程上 confidence-based 调度 + 混合 AR/diffusion 部署是 2026 年的最优策略。