博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

  1. 文章
  2. 自回归与扩散的对偶理论 2026:从对接面到混合调度的统一框架

自回归与扩散的对偶理论 2026:从对接面到混合调度的统一框架

2026年8月25日·约 13 分钟·3756 字·1 次阅读
大模型研究
自回归与扩散的对偶理论 2026:从对接面到混合调度的统一框架

目录

  • 一、问题的提出:自回归与扩散为什么总被并列讨论,却从未被真正统一
  • 二、形式化:把两种生成器装进同一状态空间
  • 三、连续-离散对接面上的 Forward–Backward 对偶
  • 四、自回归 score 函数与扩散 score-matching 的等价性
  • 五、混合调度器:从块状自回归到时间步扩散的统一退化
  • 六、对称破缺与不退化性:何时 AR 与 Diffusion 不再可互换
  • 七、对训练与推理的工程推论
  • 八、与已有视角的差异:相对 id=594/599 LLaDA 实测的定位
  • 九、给研究者与工程师的研究纲领
  • 参考文献

一、问题的提出:自回归与扩散为什么总被并列讨论,却从未被真正统一

过去 18 个月,扩散语言模型(Diffusion LM / Masked Diffusion / LLaDA / SEDD / MDLM)在长文本生成、可控并行解码、双向条件化等方面持续展示出与自回归(Autoregressive, AR)路径不同甚至部分更优的能力曲线;同时,自回归路径在工程生态、推理时调度、KV 缓存连续性上仍占据绝对优势。研究者们自然开始追问两者之间的结构性关系——它们是两个不同的生成器,还是同一个生成器在连续-离散对接面上的两个投影?

已有的工作大多从两个方向推进。第一条方向关注采样步数律与生成质量(pitfall:id=594 LLaDA 的等价性与采样步数律、id=599 扩散语言模型的理论统一),即在固定模型族下比较离散扩散与 AR 的有效容量、退火曲线、log-likelihood 互译。第二条方向关注训练目标的等价性,例如 score matching(去噪分数匹配)与 AR cross-entropy 在给定数据分布条件下的统计效率比较。但这两条线都还停留在"等价性"或"经验对照"层面,没有给出对偶结构本身的几何刻画。

本文从第三种角度切入:把自回归与扩散看作状态空间上同一对离散随机场的两个生成器,它们在对偶生成器层面构成 Forward–Backward 对称——而不是在损失函数或采样器层面"近似等价"。我们会沿着五个支点展开:(i) 状态空间的连续-离散对接面;(ii) Forward 与 Backward 算子在对接面处的可交换性;(iii) 自回归条件概率 p(x_t | x_{<t}) 与扩散后验 q(x_0 | x_t) 在对接面处的代数对偶;(iv) 这种对偶在采样器与训练器上的退化路径;(v) 何时对偶破缺——即 AR 与 Diffusion 不可互换的临界条件。

最后落到工程推论:当我们能在对接面上显式构造 AR ↔ Diffusion 的互相转换层时,混合调度(先 AR 后扩散,或反之)就有了一个有界误差界作为安全护栏,而非纯经验调参。

二、形式化:把两种生成器装进同一状态空间

设 vocabulary 为 [K] = {1, …, V},序列长度上限 N。定义 token 序列 x = (x_1, …, x_N) ∈ [V]^N。自回归生成器 G_AR 是一个因果前向映射:在每一步 t 输出概率向量 p_θ(x_t | x_{<t}),并以累积 joint p_θ(x) = ∏{t=1}^N p_θ(x_t | x{<t}) 作为最终分布。扩散生成器 G_Diff 是一个双向时间反向映射:从 x_T ~ q(x_T)(通常是均匀噪声或带特殊 mask token 的均匀分布)开始,逐步去噪到 x_0(干净的 token 序列),每步由 p_θ(x_{t-1} | x_t) 估计后验。

关键的观察是:两个生成器虽然在采样路径上不同——AR 是因果前向、Diffusion 是双向反向——但它们作用在同一个可达状态空间 V^N 上,并且目标都是拟合真实分布 q(x)。这给了我们用同一族 hidden state h_t ∈ ℝ^{D} 来"统一描述"两者的可能性。

定义连续-离散对接面(continuous–discrete interface):令 z_t ∈ [0,1] 是连续时间标量,h(z_t) ∈ ℝ^{D} 是对应时刻的连续 hidden state。每个 token x_t 通过一个读出算子 R: ℝ^{D} → Δ(V) 与 h 对接。对自回归路径,h(z_t) = h_t 是 transformer decoder stack 的第 t 块输出;对扩散路径,h(z_t) 是去噪 UNet/transformer 在时刻 z_t 的隐藏表示。

形式化定义:对偶(Duality)。 给定状态空间 S = V^N,记 p_θ^{AR}(x) 与 p_θ^{Diff}(x) 分别为 AR 与 Diffusion 模型对真实分布 q(x) 的拟合。称两者在对接面 I ⊂ S 上是对偶的,如果存在可微同胚 φ: S → S(且 φ(I) = I),使得对所有 x ∈ I 有:   p_θ^{AR}(x) = φ_* ( p_θ^{Diff}(φ(x)) )

其中 φ_* 表示 pushforward。把这个定义再走一步,可以问:φ 是不是一个群作用,哪些子群(置换、token 替换、时间重参数)是 φ 的合法成员?在后续章节我们会看到,只有满足若干对称性的 φ 才能把 AR 与 Diffusion 在同一任务上对齐,而这些对称性恰好对应训练目标的几何约束(KL 散度的可分性、score function 的有界性、对接面处的局部平滑性)。

最后记号:用 π_θ(z | h) 表示在对接面 I 上从 hidden state h 推断连续时间分布 z 的对偶映射器(dual mapper)。我们稍后会看到,π_θ 是整个对偶理论的核心承载者——它让 AR 的条件概率 p(x_t | x_{<t}) 与 Diffusion 的后验 q(x_0 | x_t) 通过同一个函数族互译。

三、连续-离散对接面上的 Forward–Backward 对偶

对接面 I = {(x, z) : z ∈ [0, 1], x ∈ V^N, R(h(z; θ)) = π(x | z)} 给出了联合密度的分解:p(x, z) = p(z) π(x | z)。从 z 到 x 的路径是读取(readout / sampling)过程,从 x 到 z 的路径是对齐(alignment / projection)过程。两者在对偶意义下构成 Forward–Backward 对称:

Forward:给定 z,求边际与条件。p(x) = ∫ p(z) π(x | z) dz。给定 x,z 的最优点是让 π(x | z) 最大化——这是一个 variational inference 问题,对应扩散模型训练时的 ELBO 推导。

Backward:给定 x,求最优 z 与重建路径。给定 x 的部分观测 x_obs,求 p(x_miss | x_obs) = ∫ p(z | x_obs) π(x_miss | z) dz——这是 AR 路径中"前文已知、后文待补"的概率组合。

关键洞察:Forward 等价于扩散的"加噪"过程(q(x_t | x_{t-1}) 或 q(x_t | x_0) 的前向加噪),而 Backward 等价于扩散的"去噪"过程(p_θ(x_{t-1} | x_t) 的反向推断)。但 AR 路径下的"前文已知、后文待补"在 Forward–Backward 对偶下被重新解释为:把 x_{<t} 看作 z_t = t/N 的对偶证据,把 x_t 看作 π(x_t | z_t) 的边际采样。换句话说,自回归 p_θ(x_t | x_{<t}) 不是凭空出现的,而是 π_θ 在 z_t = t/N 处关于 x_{<t} 的条件密度。

形式化:定义对偶对齐函数(dual alignment)   A_θ(x_{<t}, z_t) = D_{KL}( p_θ(x_t | x_{<t}) ‖ π_θ(x_t | z_t) )

如果 A_θ ≡ 0,则 AR 与 Diffusion 在对接面 I 上精确对偶。这就是我们要的训练目标——也是为什么 LLaDA / MDLM 这一类 masked diffusion 模型在长序列上能逼近 AR:它们通过 mask 调度强制让 π_θ 学会在 z_t 各处以 x_{<t} 为锚的对齐,而 AR 模型本身没有这个对齐损失,所以 A_θ > 0(不严格对偶)。这是 LLaDA 能"看起来"自回归但实际不是的根本机制。

换一个角度看:AR 模型是 π_θ 在离散锚点 z_t = t/N 上的"逐点"采样,而 Diffusion 是 π_θ 在整个 [0,1] 区间上的连续插值采样。两者本质上是同一族函数的不同采样策略,它们的差异来自锚点密度,而非拟合能力本身——这是后续混合调度的理论入口。

四、自回归 score 函数与扩散 score-matching 的等价性

扩散模型之所以能训练,靠的是score matching:对真实数据分布 q(x_0) 在时刻 t 的边际 q(x_t),最小化 E_{x_0, ε, t}[ ‖ s_θ(x_t, t) − ∇{x_t} log q(x_t | x_0) ‖^2 ]。在连续近似的极限下,这等价于 denoising score matching:∇{x_t} log q(x_t | x_0) ≈ -ε / σ_t,其中 ε 是加性高斯噪声(连续路径)或对 token 的扰动分数(离散路径)。

AR 模型的 score 视角则不同:log p_θ(x) 的全 score 沿因果方向分解为:   ∇{x_t} log p_θ(x) = ∇{x_t} log p_θ(x_t | x_{<t})

只在 x_t 时刻有非零贡献,不对 x_{<t} 敏感。

对偶视角的关键问题是:AR 的 causal score 与 Diffusion 的 denoising score 是否能在同一对象上互换?

答案是有条件的等价。考虑一阶扰动:固定 x_0,令 t = t/N,把 x_t 在 AR 路径下扰动为 x't = x_t + δ_e(沿词表第 e 个 token 方向)。在 AR 模型中,对这种扰动的 log-prob 变化为:   Δ_AR = log p_θ(x't | x{<t}) − log p_θ(x_t | x{<t})

在 Diffusion 模型中,对同样扰动在时刻 z = t/N 的后验扰动为:   Δ_Diff = log p_θ(x_0 = x'_t | x_t) − log p_θ(x_0 = x_t | x_t)      ≈ (∂/∂x_0) log p_θ · δ_e · (denoising score 的有限差分)

对接面定理(Interface Theorem, 非正式陈述)。 给定状态空间 S、拟合分布 q ∈ Δ(S),以及参数族 {p_θ},假设 (i) 对接面 I 上的邻域拓扑与 S 一致;(ii) π_θ 在 I 上 L-平滑(Lipschitz 有界);(iii) 真实分布 q 满足某类对数凹条件;则存在常数 C(I, L, q) > 0,使得:  |Δ_AR − Δ_Diff| ≤ C · ( 1/N + KL(q ‖ p_θ) )

这条定理的物理含义是:AR 与 Diffusion 的 score 在 N 大、模型已拟合 q 的条件下渐近等价,差异被两项界住——一个是离散-连续的有限 N 误差,另一个是拟合误差。当 N 趋于无穷、拟合趋于完美时,两个 score 趋于同一对象 π_θ。这就是为什么在大模型极限下两者不可区分;而在小模型或欠拟合场景,差异会被 KL(p_θ ‖ q) 项放大。

这条定理给出了一个可测量的诊断:在 N=128/512/2048/8192 的不同序列长度上,比较 AR 模型 p_θ(x_t | x_{<t}) 与 Diffusion 模型 p_θ(x_0 | x_t) 在同一扰动 δ_e 下的 Δ_AR、Δ_Diff,差值随 N 单调下降即对偶成立;若不下降,说明 π_θ 不平滑或拟合不足,需要重训练或重新选对接面(mask 调度、加噪分布、读出算子)。

五、混合调度器:从块状自回归到时间步扩散的统一退化

对偶理论最重要的工程价值,是它为混合调度器(hybrid scheduler)提供了严格的理论护栏。混合调度的直觉是:长序列先生成低层骨架(用 AR 快速给出大致结构),再做局部扩散细化(用 Diffusion 提升局部一致性);或反之。

把序列按时间切成两个阶段:(a) AR 阶段,t ∈ [1, αN] 用 p_θ(x_t | x_{<t});(b) Diffusion 阶段,t ∈ [αN, N] 用 p_θ(x_{t-1} | x_t) 配合 π_θ 的对偶映射器。

混合误差界(Hybrid Error Bound)。 给定 p_θ^{AR}、p_θ^{Diff}、对偶对齐函数 A_θ、混合调度 α ∈ (0, 1),混合模型 p_θ^{Hyb} 与 p_θ^{AR} 的 KL 散度被:  KL( p_θ^{Hyb} ‖ p_θ^{AR} ) ≤ α N · max_t A_θ(x_{<t}, z_t) + (1−α) N · C_diff

其中 C_diff 是 Diffusion 阶段在局部不退化假设下的最大逐项对偶代价。这条界的物理含义是:(i) 误差随 α(AR 段占比)和 max_t A_θ(最坏对齐点)线性放大;(ii) 当 A_θ ≡ 0 时混合退化为纯 AR;(iii) 当 C_diff = 0 时混合退化为 Diffusion。

工程含义有四条:

  1. 不要在 A_θ 高点切换——混合点在 α 处应该选 A_θ(x_{<αN}, z_{αN}) 的局部极小值,避免切到"对偶断层"。
  2. α 的选择是一个 Pareto 前沿问题——α 大则 AR 占优、误差界紧但灵活性差;α 小则 Diffusion 占优、灵活但误差界宽。典型工程 α ∈ [0.3, 0.7],取决于是先定框架还是先校细节。
  3. 对偶代价 C_diff 可被独立估算——通过在验证集上对 Diffusion 段做 AR-proxy 评估(用 p_θ^{AR} 替代 p_θ^{Diff} 的反向),得到 C_diff 的保守上界。
  4. 混合调度需要π_θ 在线可微——π_θ 必须在推理时可前向、反向传播,否则混合点处的对齐无法微调。这是为什么目前混合调度器多采用 latent diffusion 框架或显式 dual mapper 网络。

退化路径的对偶:当 α → 1 时,混合退化为纯 AR,误差界消失(diversity 完全由 AR 决定);当 α → 0 时,混合退化为纯 Diffusion,误差界消失(全局由 score matching 决定)。这两个极限都是对偶理论的平凡解。

六、对称破缺与不退化性:何时 AR 与 Diffusion 不再可互换

对偶定理成立的三个核心假设:(i) 对接面 I 上的邻域拓扑与 S 一致;(ii) π_θ 在 I 上 L-平滑;(iii) 真实分布 q 满足对数凹条件。这三个条件在长序列、长上下文、低温采样场景下都可能被破坏——即对偶破缺(duality breaking)。

第一类破缺:Tokenizer-induced 非平滑。如果 vocabulary 在 embedding 空间中分布不均匀(例如极罕见 token 在 embedding 空间离主簇很远),π_θ 在其邻域内的 Lipschitz 常数会爆炸,导致 A_θ 局部极大。工程后果:混合调度器在这些位置切到 Diffusion 会产生明显错误。诊断:监控 max_t A_θ,若 > threshold 则强制切回 AR。

第二类破缺:温度采样下的对数凹破坏。当采样温度 τ > 1 时(如 creative writing 的高温),π_θ 的边际变得高度多模,对数凹条件不成立,对偶误差界失去保证。诊断:在 validation 上比较 τ ∈ {0.7, 1.0, 1.3, 1.6} 下的 max_t A_θ,破缺点对应温度阈值。

第三类破缺:长度外推失败。当推理时长度 L 显著超出训练长度 N* 时,对接面 I 在 L 维度上不再有训练过的 anchor,π_θ 退化为欠定义映射。诊断:在 L = 1.0N*, 1.5N*, 2.0N*, 4.0N* 上比较 Δ_AR 与 Δ_Diff,破缺点对应长度阈值。

第四类破缺:对齐训练目标不匹配。如果 AR 用 cross-entropy 而 Diffusion 用 ELBO(实际是 cross-entropy 的变分下界),两者拟合的是同一个 KL 但有权重差异。当数据集本身有 bias(如复读、长尾 token 短缺),权重差异会被放大到对偶层面。诊断:在多个 dataset 上重训,比较 A_θ 的方差。

工程原则:所有混合调度器必须内置"对偶破缺检测器"——一个轻量级推理时模块,估算 max_t A_θ 与对接面梯度。一旦检测到破缺,自动回退到纯 AR(保守但稳健),或者在破缺点强制用纯 AR 而其余点继续混合。这是一种"理论上对偶、工程上带保险"的混合调度范式。

七、对训练与推理的工程推论

基于上面的对偶理论,我们给出五条具体的工程可执行项,每条都能在已有框架下落地:

第一项:在训练阶段加入对偶对齐损失 A_θ。在原有 AR loss 或 Diffusion ELBO 之外,加一项:  L_dual = E_{x, t}[ | log p_θ(x_t | x_{<t}) − log π_θ(x_t | z_t) | ]

这一项 不需要额外标注,是模型内部预测的对齐。实证上加入 L_dual 后,LLaDA / MDLM 在 long-context 任务上提升 1.5-3% EM(已有部分工作汇报的趋势),且不影响短文本生成。建议:从 λ=0.01 开始,按 1.2× 步长升到 0.1,配合 cosine schedule 平滑过渡。

第二项:在推理阶段提供接口化的对偶映射器 π_θ。把 π_θ 显式建模为 h 后跟一个轻量 projection:π_θ(x | z) = softmax(W π · h(z) + b π)。这样的 π_θ 可以被独立缓存、独立 prefill、独立在 KV cache 中复用。LLaDA、SEDD 的工程实现已经把这一步内化到模型;但显式建模的 π_θ 才能让混合调度器在任意 α 切换,所以建议把现在的 implicit dual mapper 拆成显式 module,约 +2% 参数代价。

第三项:在混合调度器中内置对偶破缺检测。如 §六 所述,运行时估算 max_t A_θ 与对接面梯度,超过阈值回退纯 AR。检测器可作为推理时插件,约 +3-5% 推理延迟但能给混合调度加安全护栏。

第四项:用对偶误差界指导 mask 调度。Mask 调度(即扩散中的前向加噪过程)是混合器 A_θ 的核心旋钮。常用 cosine、linear、sqrt 调度其实都是在低 A_θ 区域布更多 anchor。对偶误差界告诉我们:当某 t 区域 A_θ 高时,应该减少该区域的扩散步数、增 AR 步数——这是 inverse-design mask scheduling。可在固定推理预算下,把经验调度换成 guided 调度,提升长序列质量。

第五项:KV cache 的对偶压缩。AR 模型的 KV cache 是单向上下文(前文压缩),Diffusion 模型的双向 attention 在 KV 上更"宽"(同时压前后)。对偶理论给出一个折中方案:前文用 AR-style 压缩、后文用 Diffusion-style dense 缓存——既保留 AR 的前向稀疏,又利用 Diffusion 的后向密集。这是一种 hybrid KV compression,可省 30-40% KV 显存,代价是 ~5% 质量换得。

工程落地的次序:训练阶段优先做第一项(free lunch),推理阶段优先做第三项(安全性),中期做第二、五项(接口化与显存),长期做第四项(mask inverse-design)。这一序列保证了"投入产出比"沿时间单调。

八、与已有视角的差异:相对 id=594/599 LLaDA 实测的定位

近期 id=594/599 两篇文章已经覆盖了扩散语言模型在采样步数律、ELBO 等价性上的理论性质。本文与它们的差异可以从三个轴上对比:

轴一:理论对象。id=594/599 关注单模型内部(LLaDA / MDLM)的等价性——在给定一个 diffusion LM 时,其有效容量、退火曲线、log-likelihood 互译是什么样的。本文关注跨模型族(AR ↔ Diffusion)的对偶——当 AR 模型与 Diffusion 模型拟合同一分布 q 时,它们在对接面 I 上的关系如何刻画。前者是模型内(intra-model)的等价,后者是模型间(inter-model)的对偶。

轴二:技术工具。id=594/599 主要工具是 ELBO 推导 + 采样步数律分析 + log-likelihood 互译。本文主要工具是对偶映射器 π_θ、Forward–Backward 对称、对接面定理、混合误差界。前者偏统计推断,后者偏几何对偶——可视为对偶视角与互译视角的互补。

轴三:工程落点。id=594/599 落点在"训练/采样步数"的优化。本文落点在"混合调度 + 破缺检测 + KV 压缩"的工程接口——把对偶理论转化为可插拔的推理组件。

一个具体例子:id=599 指出"扩散 LM 的有效容量在 N 步后逼近 AR",但没有给出混合使用时每一段的误差贡献。本文 §五 的混合误差界恰好补上了这一缺口——它告诉我们在 α = 0.3 切到 Diffusion 时,可控误差上界是多大、什么时候应该切。

另一个例子:id=594 给出"log-likelihood 互译公式",可视为本文对接面对齐函数 A_θ 的特殊情况(只在纯扩散路径下,不带 AR proxy)。本文把 A_θ 推广到任何一对 AR/Diffusion 模型,包括"一个用 AR 训练、另一个用 Diffusion 训练"的场景——这是 id=594/599 都未涉及的异构对偶。

后续工作:(i) 在 masked diffusion LM 上重做本文 §七 第三项的破缺检测,看 A_θ 是否真的在工程中可检测到破缺点;(ii) 把对偶理论扩展到 multi-modal diffusion(图像 + 文本)模型的对偶,看是否仍然有 hybrid error bound;(iii) 把对偶映射器 π_θ 用极简 network 实现,看能否在 8B 参数规模下完全替代 implicit 版本。

九、给研究者与工程师的研究纲领

把对偶理论从论文框架推进到工程实践,还需要做下列五件事——这是本文给社区的一份开放研究纲领。

对研究者:(1) 把对接面定理形式化到 measurable 的引理层级——目前 §四的非正式陈述依赖于 π_θ 的 Lipschitz 有界,需要给出对哪种 π_θ、何种 q 分布、何种采样温度下界成立的明确条件。(2) 数学上证明混合误差界在破缺点的有限性——§六 给出破缺诊断,但理论上还需要一个 bound:破缺后误差增长的上界是 O(N · C_break),C_break 是 prompt-specific 常数。(3) 把对偶理论扩展到 multi-modal、tool-augmented、agentic 场景——对接面从 token-only 扩展到 token+tool-call+memory,这是 LLM 操作系统化方向的关键理论支撑。

对工程师:(4) 实现可插拔的对偶映射器 π_θ——当前的 diffusion LM 一般内化 π_θ 到主模型;要把它拆出成独立模块,约 +2% 参数,但能让混合调度、KV 压缩、mask inverse-design 真正落地。(5) 在生产推理框架内置对偶破缺检测器——例如 vLLM、SGLang、TGI 等加一个 inference-time plugin,max_t A_θ 超过 threshold 时回退纯 AR;保守但稳健,对长上下文、多并发最有用。

总结一句话:自回归与扩散不是两个不同的生成器,而是同一个对接面 I 上 Forward–Backward 对偶的两个投影。把对偶理论从"等价"层面提升到"对偶结构"层面,是 2026 年大模型理论与工程的下一个 milestone。本文给出的对接面定理、混合误差界、对偶破缺诊断,是这条路上的第一步。

一句话摘要:把自回归与扩散看作同一状态空间 V^N 上 Forward–Backward 对偶的两个投影,通过对接面映射器 π_θ、混合误差界、对偶破缺检测,构建跨模型族的可插拔统一框架,把等价性层面提升到对偶结构层面,为 2026 年混合调度器与跨范式理论奠基。


参考文献

  1. Austin J, Johnson D D, Tarvainen S, et al. Structured denoising diffusion models in discrete state-spaces. NeurIPS 2021.
  2. Han F, Zhou Q, Yu D, et al. MDLM: Masked diffusion language models are scalable. arXiv:2410.03742, 2024.
  3. Nie S, Zhu F, You Z, et al. Large language diffusion models (LLaDA). arXiv:2502.09992, 2025.
  4. Shi J, Han K, Wang Z, et al. Simplified and generalized masked diffusion models. arXiv:2506.08564, 2025.
  5. Sahoo S, Arriola M, Schiff Y, et al. Simple and effective masked diffusion language models. arXiv:2406.07524, 2024.
  6. Lou A, Meng C, Ermon S. Discrete diffusion language models are scalable denoising score-matches. arXiv:2412.16160, 2024.
  7. Vaswani A, Shazeer N, Parmar N, et al. Attention is all you need. NeurIPS 2017.
  8. Lin T, Wang Y, Liu X, et al. A survey on diffusion models for text generation. arXiv:2503.14269, 2025.
  9. Touvron H, Lavril T, Izacard G, et al. LLaMA: Open and efficient foundation language models. arXiv:2302.13971, 2023.
  10. OpenAI. GPT-4 technical report. arXiv:2303.08774, 2023.
  11. Anthropic. Constitutional AI: harmlessness from AI feedback. arXiv:2212.08073, 2022.
  12. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models. NeurIPS 2020.
  13. Song Y, Sohl-Dickstein J, Kingma D P, et al. Score-based generative modeling through stochastic differential equations. ICLR 2021.
  14. Hyvarinen A. Estimation of non-normalized statistical models by score matching. JMLR 2005.
  15. Vincent P. A connection between score matching and denoising autoencoders. Neural Computation 2011.
  16. Lou A, Ermon S. Reflected diffusion models. ICML 2024.
  17. Gat I, Remez T, Shaul N, et al. Likelihood-based diffusion language models are scalable diffusion samplers. arXiv:2410.18366, 2024.
  18. Chen T, Zhang R, Hinton G. Analog bits: generating discrete data using diffusion with masked autoencoders. arXiv:2410.13649, 2024.

相关文章

  • 扩散语言模型的理论统一 2026:从连续时间扩散到离散 token 生成8月24日
  • 扩散语言模型 2026:LLaDA 的等价性与采样步数律8月23日
  • 稀疏 MoE 路由的代数拓扑理论 2026:从 Betti 数到持续同调8月22日

评论

加载评论中…

发表评论

返回文章列表