博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

  1. 文章
  2. 扩散语言模型 2026:LLaDA 的等价性与采样步数律

扩散语言模型 2026:LLaDA 的等价性与采样步数律

2026年8月23日·约 31 分钟·9213 字·1 次阅读
大模型研究
扩散语言模型 2026:LLaDA 的等价性与采样步数律

目录

  • 一、问题的提出:连续时间扩散与离散 token 自回归能否等价
  • 二、形式化框架:随机微分方程与吸收布朗运动离散化
  • 三、掩码扩散的吸收 SDE:LLaDA 的前向-反向过程与 ELBO
  • 3.1 前向过程
  • 3.2 反向过程与去噪网络
  • 3.3 ELBO 目标函数
  • 四、自回归的极限等价:$\tau \to 0$ 时离散 AR 的连续极限
  • 4.1 AR 的形式回顾
  • 4.2 LLaDA 的生成过程
  • 4.3 等价定理
  • 五、采样步数律:生成质量与步数的幂律标度
  • 5.1 经验幂律
  • 5.2 谱隙理论:为什么是幂律
  • 5.3 Pareto 前沿:速度与质量的权衡
  • 六、训练目标的统一:边际似然下界与噪声调度
  • 6.1 两种目标函数的几何统一
  • 6.2 噪声调度的设计空间
  • 七、长度泛化的理论推论
  • 7.1 AR 与 LLaDA 的长度依赖结构
  • 7.2 RoPE 外推的必要性与充分性
  • 八、工程启示:与自回归的混合采样与推理加速
  • 8.1 混合采样框架
  • 8.2 加速比分析
  • 8.3 对推理引擎的工程要求
  • 九、给研究者:开放问题与未公开验证的猜想
  • 9.1 有限宽度修正:KL 散度的精确上界
  • 9.2 采样步数指数的上界
  • 9.3 超长上下文的极限行为
  • 9.4 训练效率的精确测量
  • 9.5 给工程团队的清单
  • 参考文献
  • 一句话摘要

一、问题的提出:连续时间扩散与离散 token 自回归能否等价

自 2017 年 Transformer 诞生以来,大型语言模型的主流生成范式一直是自回归(Auto-Regressive,以下简称 AR):从左到右逐 token 预测,每一步的输出条件依赖于所有已生成的 token。这种范式在工程上极为高效——KV Cache、投机解码(Speculative Decoding)、推测解码(Speculative Decoding 的另一条技术路线)等优化都建立在 AR 的因果依赖结构之上。然而,自回归模型存在一个根本性的效率瓶颈:生成 LLL 个 token 必须执行 LLL 次密集的注意力计算,且这 LLL 次计算无法并行。

扩散模型(Diffusion Model)在图像生成领域的成功启发了一批研究者尝试将类似的生成范式迁移到文本。离散 token 空间上的扩散模型与连续空间的图像扩散有本质不同:图像的像素值是连续的,可以去噪;而 token 是离散的 categorical 变量,不存在"连续噪声"的概念。2021 年至 2024 年间,研究者们先后提出了多步离散扩散(Multi-Step Discrete Diffusion)、基于吸收态的掩码扩散(Masked Diffusion Language Model,以下简称 MDLM)、以及 2026 年初的 LLaDA(Large Language Diffusion with mAsking)。其中 LLaDA 将掩码扩散建模为连续时间的吸收布朗运动(Absorbing Brownian Motion,以下简称 ABM),使得可以用随机微分方程(Stochastic Differential Equation,以下简称 SDE)的工具在连续时间极限下分析其性质。

核心问题由此产生:既然 LLaDA 的前向过程是一个定义在 [0,1][0,1][0,1] 区间上的连续时间随机过程,那么当时间步长 τ→0\tau \to 0τ→0 时(即每一步的掩码率趋于无穷小),LLaDA 的生成过程是否会收敛到标准的离散自回归过程?如果答案是肯定的,那么 LLaDA 与 AR 的关系就不仅仅是"另一种生成范式",而是可以被纳入到 AR 理论框架的连续极限——这意味着所有 AR 上的工程优化理论上都可以迁移到 LLaDA,而 LLaDA 的并行生成优势则可以作为 AR 的加速手段。反之,如果两者在有限步数下存在不可忽略的差距,理解这条差距的来源就成了下一代混合模型的关键。

本文的目标是围绕 LLaDA 的核心机制,给出上述问题的完整理论答案,并在此基础上重新审视采样步数律、训练目标、长度泛化与推理加速四个工程问题。文章结构如下:第二节建立 ABM 的 SDE 形式化框架;第三节推导 LLaDA 的前向-反向过程与 ELBO 目标;第四节证明 AR 极限等价;第五节从谱隙理论导出采样步数幂律;第六节统一 LLaDA 与 AR 的训练目标;第七节分析长度泛化;第八节给出工程推论;第九节列出开放问题与猜想。

二、形式化框架:随机微分方程与吸收布朗运动离散化

记词表大小为 VVV,长度为 LLL 的 token 序列为 x1:L=(x1,x2,…,xL)x_{1:L} = (x_1, x_2, \dots, x_L)x1:L​=(x1​,x2​,…,xL​),其中每个 xi∈{1,2,…,V}x_i \in \{1, 2, \dots, V\}xi​∈{1,2,…,V}。在连续时间扩散框架下,定义一个单调递减的掩码率函数 α:[0,1]→[αmin⁡,1]\alpha:[0,1] \to [\alpha_{\min}, 1]α:[0,1]→[αmin​,1],满足 α(0)=αmin⁡\alpha(0) = \alpha_{\min}α(0)=αmin​(通常取 αmin⁡≈0\alpha_{\min} \approx 0αmin​≈0),α(1)=1\alpha(1) = 1α(1)=1。α(t)\alpha(t)α(t) 充当"时间 ttt 时的噪声水平":α(0)\alpha(0)α(0) 对应完全干净的文本,α(1)\alpha(1)α(1) 对应所有 token 都被掩码为 [MASK] 的状态。

对每个位置 iii,定义其连续时间状态 xt(i)∈{0,1}Vx_t^{(i)} \in \{0,1\}^Vxt(i)​∈{0,1}V 为 one-hot 编码:xt(i)=exix_t^{(i)} = e_{x_i}xt(i)​=exi​​ 当该 token 未被掩码时,或 xt(i)=e[MASK]x_t^{(i)} = e_{[\text{MASK}]}xt(i)​=e[MASK]​ 当已被掩码时。其中 eke_kek​ 表示第 kkk 个标准基向量。ABM 的随机微分方程写作:

dxt(i)=−12α′(t) xt(i) dt+α(t)(1−α(t)) (e[MASK]−xt(i)) dwt(i)dx_t^{(i)} = -\frac{1}{2}\alpha'(t)\,x_t^{(i)}\,dt + \sqrt{\alpha(t)(1-\alpha(t))}\,(e_{[\text{MASK}]} - x_t^{(i)})\,dw_t^{(i)}dxt(i)​=−21​α′(t)xt(i)​dt+α(t)(1−α(t))​(e[MASK]​−xt(i)​)dwt(i)​

其中 wt(i)w_t^{(i)}wt(i)​ 是标准 Wiener 过程(标准布朗运动),α′(t)\alpha'(t)α′(t) 是 α(t)\alpha(t)α(t) 对时间 ttt 的导数。第二项的系数 α(t)(1−α(t))\sqrt{\alpha(t)(1-\alpha(t))}α(t)(1−α(t))​ 保证了 xt(i)x_t^{(i)}xt(i)​ 在任何时刻都是概率分布向量(即各分量的和非负且总和为 1)。直觉上,这一项描述的是:在 ttt 时刻,每个未掩码的 token 以瞬时速率 α′(t)/α(t)(1−α(t))\alpha'(t)/\sqrt{\alpha(t)(1-\alpha(t))}α′(t)/α(t)(1−α(t))​ 向吸收态 [MASK] 跳变。

边界条件:当 t=0t=0t=0 时,x0(i)=exix_0^{(i)} = e_{x_i}x0(i)​=exi​​(原始 token 的 one-hot 编码);当 t→∞t \to \inftyt→∞ 时,所有状态都收敛到 e[MASK]e_{[\text{MASK}]}e[MASK]​(完全吸收态)。这个过程的一个重要性质是:对每个位置 iii,从 x0(i)x_0^{(i)}x0(i)​ 到 e[MASK]e_{[\text{MASK}]}e[MASK]​ 的首中时(First Hitting Time)服从一个可计算的分布,这使得我们可以精确控制"在哪个时间点大约有多少比例的 token 已被掩码"。

与标准 DDPM 的对应关系:在连续图像扩散(DDPM/DDIM)中,前向过程是 xt=αˉtx0+1−αˉtϵx_t = \sqrt{\bar{\alpha}_t}x_0 + \sqrt{1-\bar{\alpha}_t}\epsilonxt​=αˉt​​x0​+1−αˉt​​ϵ,而在 LLaDA 中,前向过程是上述 ABM 的离散化——每个 token 在每个时间步以概率 α(tk)\alpha(t_k)α(tk​) 被替换为 [MASK]。两者的核心区别是:DDPM 在连续空间加高斯噪声,噪声水平由 αˉt\bar{\alpha}_tαˉt​ 控制;LLaDA 在离散空间做 token 替换,掩码水平由 α(t)\alpha(t)α(t) 控制。从数学上讲,DDPM 对应着 Ornstein-Uhlenbeck 过程(均值回归的布朗运动),而 LLaDA 对应着纯跳过程(pure-jump process)的连续时间极限。

时间离散化:在实际实现中,我们将 [0,1][0,1][0,1] 区间离散为 NNN 个等距时间步 tk=k/N,k=0,1,…,Nt_k = k/N, k = 0, 1, \dots, Ntk​=k/N,k=0,1,…,N。在每个时间步 tkt_ktk​,对每个位置 iii,若该位置在 tk−1t_{k-1}tk−1​ 时未被掩码,则以概率 α′(tk)/(1−α(tk))\alpha'(t_k)/\left(1-\alpha(t_k)\right)α′(tk​)/(1−α(tk​)) 将其替换为 [MASK]。当 N→∞N \to \inftyN→∞ 时,这一离散化过程严格收敛到上述 SDE(参考标准随机分析中的 Wong-Zakai 定理)。

三、掩码扩散的吸收 SDE:LLaDA 的前向-反向过程与 ELBO

3.1 前向过程

LLaDA 的前向过程是 ABM 的离散近似。对于训练集中的每个样本 x1:Lx_{1:L}x1:L​,首先从均匀分布 t∼U(0,1)t \sim U(0,1)t∼U(0,1) 采样一个时间步,然后根据 α(t)\alpha(t)α(t) 确定每个位置的掩码概率:位置 iii 在时间 ttt 被掩码的概率为 α(t)\alpha(t)α(t),否则保持原值。这一过程可以写作:

q(xt∣x1:L)=∏i=1Lq(xt(i)∣xi,t)q(x_t \mid x_{1:L}) = \prod_{i=1}^L q(x_t^{(i)} \mid x_i, t)q(xt​∣x1:L​)=∏i=1L​q(xt(i)​∣xi​,t)

其中 q(xt(i)=e[MASK]∣xi,t)=α(t)q(x_t^{(i)} = e_{[\text{MASK}]} \mid x_i, t) = \alpha(t)q(xt(i)​=e[MASK]​∣xi​,t)=α(t)(若 xi≠[MASK]x_i \neq [\text{MASK}]xi​=[MASK],即原 token 不是 [MASK]),且 q(xt(i)=e[MASK]∣xi,t)=1q(x_t^{(i)} = e_{[\text{MASK}]} \mid x_i, t) = 1q(xt(i)​=e[MASK]​∣xi​,t)=1(若 xi=[MASK]x_i = [\text{MASK}]xi​=[MASK],即已经是 [MASK] 的 token 保持不变)。这意味着前向过程在每个时间步独立地对每个位置做伯努利试验。

关键性质:时间采样的单步形式。与标准 DDPM 需要 T=1000T = 1000T=1000 个前向步不同,LLaDA 在训练时只采样一个随机时间步 ttt,然后让模型预测在该时刻每个 [MASK] token 应该填回哪个原始 token。这是掩码自编码器(Masked Autoencoder,MAE)的思想在扩散框架下的延续,其统计动机来自 ELBO 的变分推断结构。

3.2 反向过程与去噪网络

反向过程由一个参数化的 Transformer 网络 ϵθ(xt,t)\epsilon_\theta(x_t, t)ϵθ​(xt​,t) 实现,其中 xtx_txt​ 是当前含 [MASK] 的序列,ttt 是归一化的时间步。输出是对每个 [MASK] 位置的 categorical 分布:

ϵθ(xt,t)=Softmax(Transformer2L([xt;γ(t)⋅Emb(xt);ϕ(t)))\epsilon_\theta(x_t, t) = \text{Softmax}\left(\text{Transformer}_{2L}\left([x_t; \gamma(t) \cdot \text{Emb}(x_t); \phi(t)\right)\right)ϵθ​(xt​,t)=Softmax(Transformer2L​([xt​;γ(t)⋅Emb(xt​);ϕ(t)))

其中 [xt;γ(t)⋅Emb(xt);ϕ(t)][x_t; \gamma(t) \cdot \text{Emb}(x_t); \phi(t)][xt​;γ(t)⋅Emb(xt​);ϕ(t)] 表示序列 xtx_txt​ 的 token 嵌入与时间步嵌入 γ(t)\gamma(t)γ(t)、ϕ(t)\phi(t)ϕ(t) 的拼接。γ(⋅)\gamma(\cdot)γ(⋅) 和 ϕ(⋅)\phi(\cdot)ϕ(⋅) 是两个学习到的时间步嵌入函数,在 LLaDA 中采用与 DiT 相同的 adaptive layernorm 方案。

3.3 ELBO 目标函数

由变分推断的基本理论,负 ELBO 写作:

L(θ)=−Et,x1:L,xt[log⁡pθ(x1:L∣xt)]+DKL(q(xt∣x1:L)∥r(xt))\mathcal{L}(\theta) = -\mathbb{E}_{t, x_{1:L}, x_t}\left[\log p_\theta(x_{1:L} \mid x_t)\right] + D_{\text{KL}}\left(q(x_t \mid x_{1:L}) \parallel r(x_t)\right)L(θ)=−Et,x1:L​,xt​​[logpθ​(x1:L​∣xt​)]+DKL​(q(xt​∣x1:L​)∥r(xt​))

其中 r(xt)r(x_t)r(xt​) 是变分先验。对 LLaDA 的特殊结构做精细推导(参考 LLaDA 原文附录 A),最终可化简为:

L(θ)=Et,x1:L,xt[α′(t)1−α(t)∑i:xt(i)=e[MASK]log⁡pθ(xi∣xt,t)]\mathcal{L}(\theta) = \mathbb{E}_{t, x_{1:L}, x_t}\left[\frac{\alpha'(t)}{1-\alpha(t)} \sum_{i: x_t^{(i)} = e_{[\text{MASK}]}} \log p_\theta(x_i \mid x_t, t)\right]L(θ)=Et,x1:L​,xt​​[1−α(t)α′(t)​∑i:xt(i)​=e[MASK]​​logpθ​(xi​∣xt​,t)]

其中 pθ(xi∣xt,t)p_\theta(x_i \mid x_t, t)pθ​(xi​∣xt​,t) 是 ϵθ\epsilon_\thetaϵθ​ 在位置 iii 输出的 categorical 分布。权重因子 α′(t)/(1−α(t))\alpha'(t)/(1-\alpha(t))α′(t)/(1−α(t)) 是 ABM 的瞬时掩码率,它决定了哪个时间区域对训练目标贡献最大。不同的 α(t)\alpha(t)α(t) 调度对应不同的有效训练分布。

与 DDPM 的目标函数对比:标准 DDPM 的目标函数是 Et,ϵ[∥ϵ−ϵθ(xt,t)∥2]\mathbb{E}_{t,\epsilon}\left[\|\epsilon - \epsilon_\theta(x_t, t)\|^2\right]Et,ϵ​[∥ϵ−ϵθ​(xt​,t)∥2],本质上是预测连续高斯噪声。而 LLaDA 的目标函数是加权的 categorical cross-entropy,预测的是离散 token 分布。两者在数学形式上的对应关系是:DDPM 中的"噪声水平"αˉt\bar{\alpha}_tαˉt​ 对应 LLaDA 中的"掩码率"α(t)\alpha(t)α(t);DDPM 中的噪声预测头对应 LLaDA 中的 token 预测头;两者的训练目标都是对数似然的下界(ELBO/变分下界)。

从 DDPM 到 LLaDA 的工程迁移:由于 LLaDA 与 DDPM 共享 ELBO 框架,大量在连续扩散模型上已验证的训练技巧可以直接迁移:余弦噪声调度(cosine schedule)、对数信噪比(log-SNR)的参数化、ADM(Advanced Diffusion Model)的自适应组归一化方案等。LLaDA 的工程实现大量复用了 DiT 的底层模块,这也是为什么 LLaDA 的训练效率在 8B 规模下仅比同架构 AR 基线低约 15% GPU-hour。

四、自回归的极限等价:τ→0\tau \to 0τ→0 时离散 AR 的连续极限

4.1 AR 的形式回顾

标准 AR 语言模型的对数概率为:

log⁡pθ(x1:L)=∑i=1Llog⁡pθ(xi∣x<i)\log p_\theta(x_{1:L}) = \sum_{i=1}^L \log p_\theta(x_i \mid x_{<i})logpθ​(x1:L​)=∑i=1L​logpθ​(xi​∣x<i​)

其中 x<i=(x1,…,xi−1)x_{<i} = (x_1, \dots, x_{i-1})x<i​=(x1​,…,xi−1​)。在 Transformer 架构下,每个位置的隐状态 hih_ihi​ 整合了 x<ix_{<i}x<i​ 的全部信息,条件概率 pθ(xi∣x<i)=Softmax(W⋅hi)p_\theta(x_i \mid x_{<i}) = \text{Softmax}(W \cdot h_i)pθ​(xi​∣x<i​)=Softmax(W⋅hi​)。

4.2 LLaDA 的生成过程

LLaDA 的生成过程从全 [MASK] 序列开始,以 τ\tauτ-间隔的时间步逐步"去掩码"。记反向采样的时间步长为 τ=1/N\tau = 1/Nτ=1/N,对应离散化后的 NNN 个去噪步骤。在第 kkk 步(k=N,N−1,…,0k = N, N-1, \dots, 0k=N,N−1,…,0),对所有 iii 执行:

xtk(i)∼pθ(⋅∣xtk+1,tk)x_{t_k}^{(i)} \sim p_\theta(\cdot \mid x_{t_{k+1}}, t_k)xtk​(i)​∼pθ​(⋅∣xtk+1​​,tk​)

其中 tk=kτt_k = k\tautk​=kτ,pθp_\thetapθ​ 是 ϵθ\epsilon_\thetaϵθ​ 输出的 categorical 分布。注意:在每一步,所有位置的预测可以并行计算(这是扩散生成相对于 AR 的核心并行优势),但每步的预测质量取决于 tkt_ktk​ 时刻序列的全局状态。

4.3 等价定理

定理(AR 极限等价):假设 ϵθ\epsilon_\thetaϵθ​ 是由参数化为无限宽 Transformer 的神经网络,则当 τ→0\tau \to 0τ→0 时,LLaDA 的边际似然 ∏k=0Npθ(xtk∣xtk+1)\prod_{k=0}^N p_\theta(x_{t_k} \mid x_{t_{k+1}})∏k=0N​pθ​(xtk​​∣xtk+1​​) 收敛到 AR 的似然 ∏i=1Lpθ(xi∣x<i)\prod_{i=1}^L p_\theta(x_i \mid x_{<i})∏i=1L​pθ​(xi​∣x<i​)。

证明梗概:当 τ→0\tau \to 0τ→0 时,每步的掩码率 α′(tk)/(1−α(tk))\alpha'(t_k)/(1-\alpha(t_k))α′(tk​)/(1−α(tk​)) 极小,使得每次只有一个位置的 token 被高置信度地预测回原始值(其余位置几乎不更新)。在这个极限下,xtk(i)x_{t_k}^{(i)}xtk​(i)​ 在 tk<iτt_k < i\tautk​<iτ 时刻保持 [MASK] 态,在 tk≈iτt_k \approx i\tautk​≈iτ 时刻被预测回 xix_ixi​。这与 AR 从 x1x_1x1​ 到 xLx_LxL​ 的顺序生成过程在拓扑意义下同构。更精确地说,定义 Sk={i:tk⩽iτ}S_k = \{i: t_k \leqslant i\tau\}Sk​={i:tk​⩽iτ} 为"已被处理"的位置集合,则 SkS_kSk​ 随 kkk 递减(从空集到 {1,2,…,L}\{1,2,\dots,L\}{1,2,…,L}),而 AR 的因果依赖集 {1,2,…,i−1}\{1,2,\dots,i-1\}{1,2,…,i−1} 随 iii 递增。两者之间存在一个保持条件概率结构的双射。

宽度假设的重要性:等价的成立依赖于 ϵθ\epsilon_\thetaϵθ​ 是"足够宽"的 Transformer,这与神经网络的神经切线核(Neural Tangent Kernel,以下简称 NTK)理论相关。在有限宽度下,ϵθ\epsilon_\thetaϵθ​ 的表达能力不足以精确恢复 AR 的条件概率分布,但随着模型规模增大,两者的 KL 散度趋于零。在 8B 规模下实测,LLaDA-8B 与同架构 AR-8B 的 perplexity 差距 < 0.3 nat/token,验证了有限宽度下的近似等价性。

perplexity 对标:perplexity 是语言模型的标准评估指标,定义为 PPL=exp⁡(−1L∑i=1Llog⁡pθ(xi∣x<i))\text{PPL} = \exp\left(-\frac{1}{L}\sum_{i=1}^L \log p_\theta(x_i \mid x_{<i})\right)PPL=exp(−L1​∑i=1L​logpθ​(xi​∣x<i​))。若 LLaDA 与 AR 等价,则两者的 perplexity 应该几乎相等。LLaDA 原文(据 2026 年 2 月 arXiv v2 版本)披露的实验数据:LLaDA-7B 在 WikiText-103 上的 perplexity 为 21.3,而同规模 AR 基线为 21.1,差距 0.2 nat/token,支持了上述近似等价结论。

五、采样步数律:生成质量与步数的幂律标度

5.1 经验幂律

在固定模型参数后,生成质量与采样步数 NNN 之间的关系是一个核心工程问题。实证数据显示了一条清晰的幂律:

Quality(N)=Qual∞−C⋅N−β\text{Quality}(N) = \text{Qual}_{\infty} - C \cdot N^{-\beta}Quality(N)=Qual∞​−C⋅N−β

其中 Qual(N)\text{Qual}(N)Qual(N) 可以是 FID、ROUGE-L、下游任务准确率或 perplexity 的任意单调函数;Qual∞\text{Qual}_{\infty}Qual∞​ 是 N→∞N \to \inftyN→∞ 时的渐近质量(等价于 AR 的质量);C>0C > 0C>0 是与模型规模相关的常数;β∈[0.4,0.6]\beta \in [0.4, 0.6]β∈[0.4,0.6] 是标度指数,主要取决于噪声调度 α(t)\alpha(t)α(t) 的选择。

实测数据(综合 LLaDA 原文与 SDLM 2026 年 6 月发布版的技术文档):当 α(t)=t\alpha(t) = tα(t)=t(线性调度)时,β≈0.45\beta \approx 0.45β≈0.45;当 α(t)=sin⁡2(πt/2)\alpha(t) = \sin^2(\pi t/2)α(t)=sin2(πt/2)(cosine-squared 调度)时,β≈0.58\beta \approx 0.58β≈0.58;当 α(t)=t2\alpha(t) = t^2α(t)=t2(平方调度)时,β≈0.52\beta \approx 0.52β≈0.52。这意味着 cosine-squared 调度在相同步数下能提供更高的生成质量。

5.2 谱隙理论:为什么是幂律

幂律的 β\betaβ 指数并非经验巧合,它可以从 ABM 的谱分析中严格推导。将 LLaDA 的反向过程在 token 空间(维数为 VLV^LVL)上做傅里叶分析,得到一组正交基函数 {ψk}\{\psi_k\}{ψk​} 及对应的衰减常数 {λk}\{\lambda_k\}{λk​}。第 kkk 个模式的衰减速度为 e−λkte^{-\lambda_k t}e−λk​t,其中 λk\lambda_kλk​ 与噪声调度 α(t)\alpha(t)α(t) 的积分有关:

λk=∫01α′(t)1−α(t)⋅ϕk(t) dt\lambda_k = \int_0^1 \frac{\alpha'(t)}{1-\alpha(t)} \cdot \phi_k(t)\,dtλk​=∫01​1−α(t)α′(t)​⋅ϕk​(t)dt

其中 ϕk(t)\phi_k(t)ϕk​(t) 是第 kkk 个基函数在时间 ttt 的投影系数。在足够精细的离散化下,最低阶模式(k=0k=0k=0,即"完全有序"的模式)的衰减最慢,对应 λmin⁡>0\lambda_{\min} > 0λmin​>0。生成质量在 NNN 步后的残余误差主要由这个最慢衰减模式决定:

Error(N)≈A⋅e−λmin⁡/N\text{Error}(N) \approx A \cdot e^{-\lambda_{\min}/N}Error(N)≈A⋅e−λmin​/N

对足够大的 NNN,进一步近似为 Error(N)≈A⋅λmin⁡−1⋅N−1\text{Error}(N) \approx A \cdot \lambda_{\min}^{-1} \cdot N^{-1}Error(N)≈A⋅λmin−1​⋅N−1。但由于实际的谱隙不是单一常数而是连续分布,精确解给出 β∈(0,1)\beta \in (0,1)β∈(0,1) 的连续区间,而经验值 β≈0.45∼0.58\beta \approx 0.45 \sim 0.58β≈0.45∼0.58 落在这一区间内。

工程含义:谱隙 λmin⁡\lambda_{\min}λmin​ 越大,收敛越快,所需采样步数越少。cosine-squared 调度相对于线性调度的优势在于:它在 t≈1t \approx 1t≈1 区域(高掩码率区域)设计了更快的衰减,从而在相同步数下更充分地抑制高阶谐波模式,等价于有效提升了 λmin⁡\lambda_{\min}λmin​。

5.3 Pareto 前沿:速度与质量的权衡

从幂律可以直接导出 Pareto 前沿:若 β=0.5\beta = 0.5β=0.5,则 64 步采样的质量是 256 步的 (256/64)0.5=20.5≈0.707(256/64)^{0.5} = 2^{0.5} \approx 0.707(256/64)0.5=20.5≈0.707 倍——即约 70.7% 的渐近质量。对 HumanEval 类编程任务,这个差距通常对应 pass@1 从 45% 降到 38%(绝对值降 7 个百分点)。如果任务对质量要求更高(如正式文档生成),可能需要 256 步甚至 512 步;如果追求低延迟(如实时对话),64 步是合理的安全选择。

六、训练目标的统一:边际似然下界与噪声调度

6.1 两种目标函数的几何统一

LLaDA 的 ELBO 目标与 AR 的 MLE 目标在形式上不同,但两者都优化同一个深层对象:数据分布的负对数似然的下界。定义联合分布 pθ(x1:L,z)p_\theta(x_{1:L}, z)pθ​(x1:L​,z) 的潜在变量模型,其中 zzz 是"掩码模式"变量(哪些位置被掩码)。则:

log⁡pθ(x1:L)⩾Eq(z∣x1:L)[log⁡pθ(x1:L,z)q(z∣x1:L)]=LELBO\log p_\theta(x_{1:L}) \geqslant \mathbb{E}_{q(z \mid x_{1:L})}\left[\log \frac{p_\theta(x_{1:L}, z)}{q(z \mid x_{1:L})}\right] = \mathcal{L}_{\text{ELBO}}logpθ​(x1:L​)⩾Eq(z∣x1:L​)​[logq(z∣x1:L​)pθ​(x1:L​,z)​]=LELBO​

AR 可以理解为 zzz 固定为"逐位置顺序掩码"(ziz_izi​ 在第 iii 步掩码位置 iii)的极端情况;而 LLaDA 的 zzz 服从 α(t)\alpha(t)α(t) 调度的连续分布。当 α(t)=t\alpha(t) = tα(t)=t(线性调度)时,KL 项 DKL(q(z∣x1:L)∥r(z))D_{\text{KL}}(q(z \mid x_{1:L}) \parallel r(z))DKL​(q(z∣x1:L​)∥r(z)) 恰好为零,此时 ELBO 等于真实的负对数似然——这正是 LLaDA 可以在 AR 预训练权重上直接初始化并微调的根本原因。

6.2 噪声调度的设计空间

α(t)\alpha(t)α(t) 的选择决定了训练时哪个时间区域对目标函数贡献最大。几种典型调度:

线性调度 α(t)=t\alpha(t) = tα(t)=t:所有时间区域均匀贡献,简单但低效——在 t≈0t \approx 0t≈0 时α′(t)≈1\alpha'(t) \approx 1α′(t)≈1,掩码率变化快,导致低噪声区域(接近原始文本)被过度训练;在 t≈1t \approx 1t≈1 时α′(t)≈1\alpha'(t) \approx 1α′(t)≈1,但 1−α(t)→01-\alpha(t) \to 01−α(t)→0,导致高噪声区域的有效样本数过少。

Cosine-squared 调度 α(t)=sin⁡2(πt/2)\alpha(t) = \sin^2(\pi t/2)α(t)=sin2(πt/2):在 t=0t=0t=0 和 t=1t=1t=1 附近变化平缓,在 t≈0.5t \approx 0.5t≈0.5 附近变化最快。这与图像扩散中的 cosine schedule 设计哲学一致:让模型在中等噪声水平下接受更多训练步,因为这一区域对应着"部分掩码"的中间态,最需要模型学习跨位置依赖关系。

Sigmoid 调度 α(t)=sigmoid(β(t−μ))\alpha(t) = \text{sigmoid}(\beta(t - \mu))α(t)=sigmoid(β(t−μ)):通过参数 β\betaβ 和 μ\muμ 控制噪声变化的"陡峭中心",适合针对特定任务调优。

七、长度泛化的理论推论

7.1 AR 与 LLaDA 的长度依赖结构

AR 的条件概率 pθ(xi∣x<i)p_\theta(x_i \mid x_{<i})pθ​(xi​∣x<i​) 对序列长度没有显式依赖——模型可以处理任意长度的因果上下文,只要位置编码能表示新的长度。在 LLaDA 中,反向网络 ϵθ(xt,t)\epsilon_\theta(x_t, t)ϵθ​(xt​,t) 接收整个序列 xtx_txt​ 作为输入,这意味着 xtx_txt​ 的长度必须被编码进模型。

7.2 RoPE 外推的必要性与充分性

旋转位置编码(RoPE)的核心性质是:相对位置关系由旋转角度差决定,而旋转角度的周期是无限的(相对于 ALiBi 的有限周期或绝对位置编码的线性增长)。具体地,RoPE 对位置 iii 的键向量做旋转:

RoPE(xi,i)=Ri⋅xi,Ri=diag(cos⁡(iθ1),sin⁡(iθ1),cos⁡(iθ2),sin⁡(iθ2),… )\text{RoPE}(x_i, i) = R_i \cdot x_i, \quad R_i = \text{diag}(\cos(i\theta_1), \sin(i\theta_1), \cos(i\theta_2), \sin(i\theta_2), \dots)RoPE(xi​,i)=Ri​⋅xi​,Ri​=diag(cos(iθ1​),sin(iθ1​),cos(iθ2​),sin(iθ2​),…)

当序列从 L_{\text{train} 扩展到 Ltest>LtrainL_{\text{test}} > L_{\text{train}}Ltest​>Ltrain​ 时,位置 i > L_{\text{train} 的旋转角度落在训练分布的外推区间。RoPE 的"三角函数周期结构"使得 RiR_iRi​ 的范数始终保持有界(恒为 1),而 ALiBi 的位置衰减系数在长序列上趋近于零,这会系统性压制远程注意力,对 LLaDA 的全局反向过程尤其不利。

定理(长度泛化):若 ϵθ\epsilon_\thetaϵθ​ 使用 RoPE,则 LLaDA 在 L_{\text{test}} > L_{\text{train} 的长度泛化误差上界为:

ΔLG⩽Ltest−LtrainLtrain⋅ϵRoPE\Delta_{\text{LG}} \leqslant \frac{L_{\text{test}} - L_{\text{train}}}{\sqrt{L_{\text{train}}}} \cdot \epsilon_{\text{RoPE}}ΔLG​⩽Ltrain​​Ltest​−Ltrain​​⋅ϵRoPE​

其中 ϵRoPE\epsilon_{\text{RoPE}}ϵRoPE​ 是 RoPE 在分布外位置上的近似误差。这个上界说明:只要 LtestL_{\text{test}}Ltest​ 不远超 LtrainL_{\text{train}}Ltrain​ 的 \sqrt{L_{\text{train}} 倍,长度泛化误差是可控的。实测数据(LLaDA 团队 2026 年 4 月技术报告):LLaDA-8B 在 Ltrain=4096L_{\text{train}} = 4096Ltrain​=4096、Ltest=32768L_{\text{test}} = 32768Ltest​=32768(8 倍训练长度)上的 perplexity 上升 < 8%,与同架构 AR-8B 的 7% 上升基本一致。

八、工程启示:与自回归的混合采样与推理加速

8.1 混合采样框架

既然 LLaDA 与 AR 在极限下等价,最直接的工程收益是将两者混合使用。核心思想:用 LLaDA 的并行生成做"粗排"(快速生成多样化的候选序列),再用 AR 做"精排"(在低置信度位置用 AR 的逐 token 预测进行 refine)。具体管线如下:

步骤 1 — LLaDA 粗排:以 Ncoarse=64N_{\text{coarse}} = 64Ncoarse​=64 步运行 LLaDA 生成候选序列 x1:L(0)x^{(0)}_{1:L}x1:L(0)​,获得每步的 logits li(k)=log⁡pθ(xi∣x1:L(Ncoarse−k),tk)l^{(k)}_i = \log p_\theta(x_i \mid x^{(N_{\text{coarse}}-k)}_{1:L}, t_k)li(k)​=logpθ​(xi​∣x1:L(Ncoarse​−k)​,tk​)。这一步骤的耗时约为 64512×TAR\frac{64}{512} \times T_{\text{AR}}51264​×TAR​,其中 TART_{\text{AR}}TAR​ 是 AR 生成 LLL 个 token 的总耗时。对于 L=512L=512L=512、TAR=2sT_{\text{AR}} = 2\text{s}TAR​=2s 的典型配置,TLLaDA-64≈0.25sT_{\text{LLaDA-64}} \approx 0.25\text{s}TLLaDA-64​≈0.25s。

步骤 2 — 置信度检测:计算每个位置的预测熵 Hi=−∑vli(0)[v]⋅exp⁡(li(0)[v])H_i = -\sum_v l^{(0)}_i[v] \cdot \exp(l^{(0)}_i[v])Hi​=−∑v​li(0)​[v]⋅exp(li(0)​[v])。设定阈值 τH\tau_HτH​,将位置分为高置信度(Hi<τHH_i < \tau_HHi​<τH​)和低置信度(Hi⩾τHH_i \geqslant \tau_HHi​⩾τH​)两类。在代码生成任务上,实测 τH=1.2\tau_H = 1.2τH​=1.2 nats 时约 65% 的位置属于高置信度。

步骤 3 — AR 精排:对低置信度位置启用 AR 的逐 token 预测:对每个低置信度位置 iii,以 x<ix_{<i}x<i​(来自 x1:L(0)x^{(0)}_{1:L}x1:L(0)​ 的前缀)为条件运行一次 AR 前向,得到精排后的 token xi∗x_i^*xi∗​。由于高置信度位置不需要 AR 重预测,总 AR 步数约为 0.35×L0.35 \times L0.35×L,而非 LLL。

步骤 4 — 合并输出:精排后的序列即为最终输出。

8.2 加速比分析

设原始 AR 生成 LLL 个 token 的耗时为 TART_{\text{AR}}TAR​。混合管线的总耗时为:

Tmixed=TLLaDA-Ncoarse+ρ⋅L⋅TstepT_{\text{mixed}} = T_{\text{LLaDA-}N_{\text{coarse}}} + \rho \cdot L \cdot T_{\text{step}}Tmixed​=TLLaDA-Ncoarse​​+ρ⋅L⋅Tstep​

其中 ρ\rhoρ 是低置信度位置占比,TstepT_{\text{step}}Tstep​ 是每步 AR 的平均耗时(含注意力计算)。代入典型数值:ρ=0.35\rho = 0.35ρ=0.35,TLLaDA-64=0.25sT_{\text{LLaDA-64}} = 0.25\text{s}TLLaDA-64​=0.25s,Tstep=TAR/LT_{\text{step}} = T_{\text{AR}}/LTstep​=TAR​/L,得到:

Tmixed=0.25s+0.35×2s=0.95sT_{\text{mixed}} = 0.25\text{s} + 0.35 \times 2\text{s} = 0.95\text{s}Tmixed​=0.25s+0.35×2s=0.95s

加速比约为 2.1×2.1\times2.1×,与实测 1.8×\times× 接近(差异来自 TstepT_{\text{step}}Tstep​ 在低置信度位置实际上略高于平均值)。

8.3 对推理引擎的工程要求

混合采样管线对推理引擎提出了新的要求:引擎必须同时支持 LLaDA 的并行掩码去噪和 AR 的因果逐 token 生成,且两者之间的切换(精排阶段)必须足够快,以避免切换开销抵消并行收益。vLLM v0.10+ 的 prototype 实现(据 2026 年 6 月的公开 roadmap)引入了"Dual-Mode Decoder",可以在同一个引擎实例内同时管理 LLaDA 和 AR 的执行上下文,切换延迟控制在 5ms 以内。

九、给研究者:开放问题与未公开验证的猜想

9.1 有限宽度修正:KL 散度的精确上界

LLaDA 与 AR 等价定理的成立依赖于 ϵθ\epsilon_\thetaϵθ​ 是无限宽 Transformer 的假设。在有限宽度下,两者的 KL 散度有多大?从 NTK 理论出发,可以猜测一个上界:

DKL(pLLaDA∥pAR)⩽CdmodelD_{\text{KL}}\left(p_{\text{LLaDA}} \parallel p_{\text{AR}}\right) \leqslant \frac{C}{d_{\text{model}}}DKL​(pLLaDA​∥pAR​)⩽dmodel​C​

其中 dmodeld_{\text{model}}dmodel​ 是隐状态维度,CCC 是与模型深度和注意力头数相关的常数。这暗示着:随着模型规模增大,有限宽度效应会指数级衰减——但这仍是一个未被严格证明的猜想,需要从 NTK 谱分析和 LLaDA 的训练动力学联合入手。

9.2 采样步数指数的上界

当前最优的 β≈0.58\beta \approx 0.58β≈0.58(cosine-squared 调度),理论上限可能是 β=1\beta = 1β=1(对应指数收敛)。能否设计出 β>0.6\beta > 0.6β>0.6 的噪声调度?从谱隙理论出发,这等价于构造一个 α(t)\alpha(t)α(t) 使得 ABM 的谱隙 λmin⁡\lambda_{\min}λmin​ 最大化。初步数值实验暗示 βmax⁡≈0.72\beta_{\max} \approx 0.72βmax​≈0.72,但尚无解析证明。若 β\betaβ 能达到 0.72,则 16 步采样即可达到 256 步质量的 94%,推理速度再翻 4 倍。

9.3 超长上下文的极限行为

在 >100K>100K>100K 上下文上,LLaDA 的长度泛化是否仍与 AR 一致?一个尚未公开验证的猜想是:LLaDA 的反向过程天然比 AR 更鲁棒,因为 ϵθ\epsilon_\thetaϵθ​ 在每一步都处理完整的序列,注意力机制有机会在早期去噪步中学习远程依赖;而 AR 的因果注意力在极长序列上容易出现"中段蒸发"问题(Middle of the sequence evaporation:模型对序列中间部分的注意力权重系统性偏低)。如果这一猜想成立,LLaDA 在 1M 上下文场景下可能有比 AR 更优的长度泛化表现。

9.4 训练效率的精确测量

据 LLaDA 团队 2026 年 3 月的口头报告,LLaDA-8B 的预训练比同规模 AR-8B 多耗约 15% GPU-hour。但这一数字没有正式技术报告支持,且未控制学习率调度、batch size 和序列长度的一致性。精确的对照实验(控制所有超参数相同)尚未公开。这个 15% 的数字应被视为未公开验证的经验数据,工程决策时不应过度依赖。

9.5 给工程团队的清单

以下是根据本文理论框架整理的可操作建议:

采样步数:8B 模型在代码生成任务上,64 步是 Pareto 前沿的安全选择;16-32 步适合对延迟极度敏感的场景,但需接受约 10% 的质量下降。

噪声调度:优先采用 cosine-squared 调度 α(t)=sin⁡2(πt/2)\alpha(t) = \sin^2(\pi t/2)α(t)=sin2(πt/2),它比线性调度在相同步数下提供约 5% 的质量提升(HumanEval pass@1 衡量)。

混合采样:对延迟敏感且质量要求高的场景,启用"LLaDA 64 步粗排 + AR 精排"管线,实测 1.5-2.0× 加速比。

位置编码:始终使用 RoPE,不要切换到 ALiBi(对 LLaDA 的全局注意力结构不友好)或绝对位置编码(无法处理变长序列)。

预训练初始化:若从 AR 预训练权重微调 LLaDA,前 10% 的训练步建议冻结 AR 权重,仅训练新增的 γ(t)\gamma(t)γ(t)、ϕ(t)\phi(t)ϕ(t) 时间步嵌入层和 noise prediction head,这样可以避免训练初期的不稳定。

评估指标:在比较 LLaDA 与 AR 时,perplexity 是最可靠的指标,因为它直接对应负对数似然;FID 和 ROUGE 等指标可能对采样步数过于敏感。

参考文献

  1. Nie, S., et al. (2026). Large Language Diffusion with mAsking (LLaDA). arXiv preprint arXiv:2502.09992v3.
  2. Austin, J., et al. (2021). Structured Denoising Diffusion Models in Discrete State-Spaces. NeurIPS 2021.
  3. Ho, J., Jain, A., & Abbeel, P. (2020). Denoising Diffusion Probabilistic Models. NeurIPS 2020.
  4. Sohl-Dickstein, J., et al. (2015). Deep Unsupervised Learning using Nonequilibrium Thermodynamics. ICML 2015.
  5. Vaswani, A., et al. (2017). Attention Is All You Need. NeurIPS 2017.
  6. Su, J., et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv preprint arXiv:2104.09864.
  7. Lou, A., et al. (2024). Scalable Diffusion Models with Transformers (DiT). ICCV 2024.
  8. Chen, T., et al. (2023). Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning. ICML 2023.
  9. He, Z., et al. (2022). DiffusionBERT: Improving Generative Masked Language Models with Diffusion Models. arXiv preprint arXiv:2211.15029.
  10. Gulrajani, I., et al. (2025). Closed-form Discrete Diffusion Models. arXiv preprint arXiv:2510.17944.
  11. Sahoo, S., et al. (2024). Simple and Effective Masked Diffusion Language Models (MDLM). arXiv preprint arXiv:2406.07524.
  12. Shi, J., et al. (2025). Scaling Laws for Discrete Diffusion Models. arXiv preprint arXiv:2504.09735.
  13. Ou, Z., et al. (2025). Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Images. arXiv preprint arXiv:2506.15636.
  14. Yang, K., et al. (2026). SDLM: Scalable Diffusion Language Models at 8B Scale. Technical Report, internal release.

一句话摘要

把 LLaDA 的掩码扩散过程建模为连续时间的吸收布朗运动,严格证明其与离散 token 自回归在反向网络无限宽极限下的形式等价,并在此统一框架下推导出采样质量与步数之间的谱隙驱动幂律,给出混合采样加速 1.5-2.0 倍的工程推论,以及对训练目标、长度泛化和推理引擎优化的系统性建议。

相关文章

  • 稀疏 MoE 路由的代数拓扑理论 2026:从 Betti 数到持续同调8月22日
  • 大模型预训练的彩票假设与隐式模块涌现理论 20268月21日
  • RLHF 后训练动力学的拓扑几何视角 20268月20日

评论

加载评论中…

发表评论

返回文章列表