博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

  1. 文章
  2. 稀疏注意力机制的理论统一 2026

稀疏注意力机制的理论统一 2026

2026年8月10日·约 21 分钟·6137 字·0 次阅读
大模型研究
稀疏注意力机制的理论统一 2026

目录

  • 一、问题的提出:标准注意力的复杂度瓶颈与稀疏化的动机
  • 二、形式化框架:注意力的算子分解与稀疏化的三个轴
  • 三、局部稀疏:滑动窗口 / Longformer / BigBird 的几何
  • 四、低秩近似:线性注意力 / Performer / 核方法的频谱分析
  • 五、哈希稀疏:Routing Transformer / Reformer / 桶分配
  • 六、信息论统一视角:稀疏性的率失真上界
  • 七、频谱分析:稀疏注意力对特征值分布的影响
  • 八、长度外推:稀疏结构对 OOD 长度的归纳偏置
  • 九、对工程实践的推论:选型决策树与混合稀疏策略
  • 参考文献

一、问题的提出:标准注意力的复杂度瓶颈与稀疏化的动机

Transformer 自 2017 年提出以来,几乎成为序列建模的事实标准架构。其核心组件——缩放点积注意力——在序列长度 nnn 上的计算复杂度为 O(n2)O(n^2)O(n2),内存占用同样为 O(n2)O(n^2)O(n2)(在反向传播中存储注意力矩阵)。这意味着当上下文窗口从 2K 扩展到 32K、128K 甚至 1M 时,计算量以平方级增长,显存占用也按平方级膨胀。这个根本性的复杂度瓶颈在过去五年间催生了大量研究工作,试图在保持注意力机制表达能力的同时显著降低其复杂度。

我们把这些工作统称为"稀疏注意力"(sparse attention)机制。但"稀疏"这个词本身具有多种含义:它可以指计算图的稀疏性(只计算部分位置对之间的注意力分数),也可以指表示的稀疏性(用低秩近似压缩注意力矩阵),还可以指结构化的稀疏模式(按预定义的窗口、块或哈希桶进行划分)。本文试图在统一的形式化框架下分析这三种稀疏化路径,从信息论和频谱分析的角度揭示它们的本质联系与权衡。

具体的工程动机包括三个层面:第一,长文档理解(如长 PDF、代码库、长视频字幕)需要远超 8K 上下文才能保留全局依赖;第二,推理成本压缩——128K 上下文的注意力矩阵在 A100 上需要约 64GB 显存(bf16),这远超单卡容量;第三,训练效率提升——稀疏化可以将训练吞吐量提高 3-10 倍,使得在有限算力下能训练更长上下文的模型。然而,稀疏化并非没有代价:它引入了归纳偏置(inductive bias),可能导致模型在某些长程依赖上的建模能力下降。我们需要一套系统化的理论来分析"哪些稀疏模式损失了什么"以及"在哪些任务上损失可接受"。

二、形式化框架:注意力的算子分解与稀疏化的三个轴

我们首先给出标准注意力的算子定义。给定查询矩阵 Q∈Rn×dQ \in \mathbb{R}^{n \times d}Q∈Rn×d、键矩阵 K∈Rn×dK \in \mathbb{R}^{n \times d}K∈Rn×d、值矩阵 V∈Rn×dV \in \mathbb{R}^{n \times d}V∈Rn×d,标准注意力算子定义为:

Attn(Q,K,V)=softmax(QK⊤d)V\mathrm{Attn}(Q, K, V) = \mathrm{softmax}\left(\frac{QK^\top}{\sqrt{d}}\right) VAttn(Q,K,V)=softmax(d​QK⊤​)V

其中 softmax 是按行进行的。计算 QK⊤QK^\topQK⊤ 是 O(n2d)O(n^2 d)O(n2d) 的矩阵乘法,整体算子复杂度为 O(n2d)O(n^2 d)O(n2d)。我们关心的稀疏化路径可以分解为三个独立的轴:

轴一:计算图稀疏——只对部分 (i,j)(i,j)(i,j) 对计算注意力分数,其余位置被 mask 掉(即设 αij=0\alpha_{ij} = 0αij​=0 或 −∞-\infty−∞)。这包括滑动窗口注意力(Longformer 的局部窗口)、块稀疏(BigBird 的随机块)、哈希桶(Reformer 的 LSH 分桶)。计算复杂度通常降到 O(nlog⁡n)O(n \log n)O(nlogn) 或 O(nn)O(n \sqrt{n})O(nn​)。

轴二:低秩分解——不计算完整的 n×nn \times nn×n 注意力矩阵,而是用低秩近似 A~=QK⊤≈LR⊤\tilde{A} = QK^\top \approx LR^\topA~=QK⊤≈LR⊤,其中 L∈Rn×r,R∈Rn×rL \in \mathbb{R}^{n \times r}, R \in \mathbb{R}^{n \times r}L∈Rn×r,R∈Rn×r,r≪nr \ll nr≪n。代表工作包括 Performer 的 FAVOR+(基于正交随机特征的核方法)、Linear Transformer 的 ϕ(Q)ϕ(K)⊤\phi(Q)\phi(K)^\topϕ(Q)ϕ(K)⊤ 分解。计算复杂度可降到 O(nr)O(nr)O(nr) 甚至 O(n)O(n)O(n)(若 r=O(1)r = O(1)r=O(1))。

轴三:混合稀疏——同时利用多个稀疏头组合,每个头采用不同的稀疏模式。如 BigBird 同时使用全局 token、局部窗口和随机连接;Longformer 在局部窗口基础上加入少量全局 token。这是计算图稀疏的扩展。

从算子视角看,这三条路径的目标都是在不同误差度量下逼近标准注意力的输出。具体地,我们可以定义相对误差 ϵ=∥Attn(Q,K,V)−SparseAttn(Q,K,V)∥F/∥Attn(Q,K,V)∥F\epsilon = \|\mathrm{Attn}(Q,K,V) - \mathrm{SparseAttn}(Q,K,V)\|_F / \|\mathrm{Attn}(Q,K,V)\|_Fϵ=∥Attn(Q,K,V)−SparseAttn(Q,K,V)∥F​/∥Attn(Q,K,V)∥F​,研究 ϵ\epsilonϵ 与稀疏度之间的帕累托前沿。后续章节我们将从几何、数值和信息论三个角度分析这三条路径。

三、局部稀疏:滑动窗口 / Longformer / BigBird 的几何

局部稀疏是工程上最常用、最稳定的稀疏化路径。其核心思想是:假设大部分依赖关系集中在相邻 token 之间,因此只需在局部窗口内计算注意力。具体地,对于位置 iii,只计算 {j:∣i−j∣≤w}\{j : |i-j| \leq w\}{j:∣i−j∣≤w} 范围内的注意力分数,窗口大小 www 通常为 256、512 或 1024。计算复杂度降为 O(nw)O(nw)O(nw),即线性复杂度。Longformer 是该路径的代表作,其滑动窗口头与少量全局头组合,实现了 4096+ 长度的有效建模。

BigBird 进一步扩展了局部稀疏,加入了随机块连接——每个位置额外连接 n\sqrt{n}n​ 个随机位置——以增强长程依赖。理论上 BigBird 证明了稀疏注意力是图灵完备的(universal approximation),前提是满足特定稀疏度条件。但实际应用中,BigBird 的随机块通常用预生成的随机种子实现,并非每步重新采样。

从几何视角看,局部稀疏本质上假设注意力矩阵 AAA 是带状占优的(banded-dominant),即 ∣Aij∣≈f(∣i−j∣)|A_{ij}| \approx f(|i-j|)∣Aij​∣≈f(∣i−j∣) 是 ∣i−j∣|i-j|∣i−j∣ 的单调函数。这一假设在自然语言中部分成立:相邻 token 之间的相关性通常较高,但代词回指("他"、"它")可能跨越长距离。这一假设在代码、JSON 等结构化数据上更弱,因为变量定义与使用可能相隔数百 token。

滑动窗口的频谱性质:我们把注意力矩阵 AAA 视为非负行随机矩阵(每行和为 1,因为 softmax),其特征值分布决定了它对长程信号的传递能力。带状矩阵的特征值衰减速率与带宽 www 呈多项式关系——具体地,对 Toeplitz 类带状矩阵,特征值按 λk∼1/(1+k2)\lambda_k \sim 1/(1+k^2)λk​∼1/(1+k2) 衰减。这意味着滑动窗口能保留前 O(w)O(w)O(w) 个特征值所对应的低频成分,但对高频成分(长程交互)会显著衰减。在长文档建模中,这意味着模型更擅长捕获局部语法结构,但对跨章节的主题关联会丢失。

值得注意的工程经验:滑动窗口 + 少量全局 token(如 [CLS]、问题 token)的混合策略在 NIAH(needle-in-a-haystack)任务上表现良好,因为全局 token 充当了"信息中继"——它们在每一层都被所有 token 关注,反向也关注所有 token,从而在带状结构中"跳跃式"传递信息。但全局 token 的数量需要谨慎选择——太少则长程信息传递不足,太多则退化回标准注意力。

四、低秩近似:线性注意力 / Performer / 核方法的频谱分析

低秩稀疏路径的核心思想是用 ϕ(Q)ϕ(K)⊤\phi(Q)\phi(K)^\topϕ(Q)ϕ(K)⊤ 近似 softmax 核,其中 ϕ:Rd→Rr\phi: \mathbb{R}^d \to \mathbb{R}^rϕ:Rd→Rr 是一个随机或确定性映射。最简形式是 Linear Transformer(Katharopoulos et al., 2020):ϕ(x)=elu(x)+1\phi(x) = \mathrm{elu}(x) + 1ϕ(x)=elu(x)+1,然后利用结合律将 ϕ(Q)(ϕ(K)⊤V)\phi(Q)(\phi(K)^\top V)ϕ(Q)(ϕ(K)⊤V) 计算顺序改为 (ϕ(Q)ϕ(K)⊤)V(\phi(Q)\phi(K)^\top)V(ϕ(Q)ϕ(K)⊤)V,复杂度从 O(n2d)O(n^2 d)O(n2d) 降为 O(nrd)O(nrd)O(nrd)。当 r=O(d)r=O(d)r=O(d) 时仍是线性。

Performer( Choromanski et al., 2021)使用正交随机特征 ϕ(x)=1/r[cos⁡(ωk⊤x),sin⁡(ωk⊤x)]k=1r\phi(x) = \sqrt{1/r}[\cos(\omega_k^\top x), \sin(\omega_k^\top x)]_{k=1}^rϕ(x)=1/r​[cos(ωk⊤​x),sin(ωk⊤​x)]k=1r​ 来无偏估计 softmax 核——即 E[ϕ(x)⊤ϕ(y)]=exp⁡(x⊤y)\mathbb{E}[\phi(x)^\top \phi(y)] = \exp(x^\top y)E[ϕ(x)⊤ϕ(y)]=exp(x⊤y)。当 r=O(dlog⁡d/ϵ2)r = O(d \log d / \epsilon^2)r=O(dlogd/ϵ2) 时,相对误差以高概率控制在 ϵ\epsilonϵ 以内。FAVOR+ 算法在 8K 长度上实测比标准注意力快 4-6 倍,精度损失通常 < 1%。

从频谱分析看,低秩近似的核心假设是 softmax 注意力矩阵 AAA 的有效秩远小于 nnn。具体地,如果查询-键矩阵 QK⊤QK^\topQK⊤ 的奇异值衰减快(按指数或多项式),则 A=softmax(QK⊤/d)A = \mathrm{softmax}(QK^\top / \sqrt{d})A=softmax(QK⊤/d​) 也会保留这一性质。在自然语言中,由于词义分布在嵌入空间是低维流形(manifold hypothesis),QQQ 和 KKK 的有效秩通常为 O(d)O(\sqrt{d})O(d​) 至 O(d)O(d)O(d)。这解释了为什么 Linear Transformer 在语言建模上能用 r=dr=dr=d 取得接近标准注意力的困惑度(perplexity)。

然而,低秩近似有一个根本限制:它假设注意力矩阵是低秩的,但忽略了 softmax 归一化对秩的拉伸效应。具体地,softmax 把任意输入矩阵的行归一化为概率分布,这一过程倾向于增加矩阵的有效秩(因为每行和约束减少了秩自由度)。理论与实证上,softmax 之后的注意力矩阵的秩通常比 softmax 之前高 1-2 个数量级。这意味着低秩近似需要 r=O(n)r = O(n)r=O(n) 才能精确逼近 softmax 输出,远超 Linear Transformer 的 r=O(d)r=O(d)r=O(d) 设置。这是 Linear Transformer 在某些长程任务上表现欠佳的根本原因。

核方法的随机特征理论告诉我们:为了达到 ϵ\epsilonϵ 相对误差,FAVOR+ 需要 r=O(dlog⁡d/ϵ2)r = O(d \log d / \epsilon^2)r=O(dlogd/ϵ2) 个特征。当 d=64,ϵ=0.1d=64, \epsilon=0.1d=64,ϵ=0.1 时 r≈64×6×100=38400r \approx 64 \times 6 \times 100 = 38400r≈64×6×100=38400,这远超实际可用维度。因此实际部署的 Linear Transformer(r=dr=dr=d)是用更大误差换取了速度,而非真正无偏估计 softmax 核。

五、哈希稀疏:Routing Transformer / Reformer / 桶分配

哈希稀疏路径通过哈希函数将相似的查询-键对分配到同一桶中,只在桶内计算注意力。Reformer(Kitaev et al., 2020)使用位置敏感哈希(LSH)将 Q,KQ, KQ,K 通过随机超平面投影后分桶,理论上同桶内的 query-key 对大概率有高注意力分数。桶大小通常设为 b=64b=64b=64,桶数量 n/bn/bn/b,总计算 O(nb)O(nb)O(nb)。Routing Transformer(Roy et al., 2021)使用学习的聚类(k-means)替代 LSH,桶分配更稳定但需要额外训练。

从几何视角看,哈希稀疏本质上把注意力矩阵 AAA 在"查询空间"上进行聚类划分。LSH 的理论性质是:对于查询 qqq 和键 kkk,若 ⟨q,k⟩\langle q, k \rangle⟨q,k⟩ 大(即 kkk 是 qqq 的相关 key),则 qqq 和 kkk 高概率被分到同一桶。这是 locality-sensitive hashing 的标准保证(Indyk-Motwani 1998)。但是,LSH 保证的是"高内积高概率同桶",不保证"低内积低概率同桶"——即哈希有 recall 偏向,桶内可能含有许多不相关的 key,导致桶内 softmax 仍需要精细选择 top-kkk。

实际工程上,Routing Transformer 和 Reformer 都采用"分桶 + 桶内 top-kkk"的两阶段策略:第一阶段粗筛(同桶),第二阶段细筛(桶内 top-kkk)。这进一步将复杂度从 O(nb)O(nb)O(nb) 降到 O(nk)O(nk)O(nk),kkk 通常为 32-64。两阶段策略的频谱性质是:第一阶段保留高能量成分(与 LSH 的高内积保证一致),第二阶段过滤桶内低能量成分(softmax 的稀疏性)。两步叠加可以逼近原矩阵的前 kkk 个奇异值所对应的低秩结构。

哈希稀疏的主要挑战是桶分配的稳定性:训练中查询-键分布在变化,导致同一对 (q,k)(q,k)(q,k) 可能跨阶段被分到不同桶(bucket reshuffle)。Reformer 通过 multi-round LSH(每一层用不同的 LSH 投影)部分缓解,但增加了常数倍计算。Routing Transformer 通过 k-means 周期性更新聚类中心来稳定桶分配,但每 k 步需要一次额外的前向传播用于聚类。这种"桶分配不稳定 + 周期性重聚类"的工程开销是哈希稀疏的实际部署瓶颈。

六、信息论统一视角:稀疏性的率失真上界

前述三种稀疏路径虽然具体机制不同,但都可以从信息论角度统一分析。我们定义"稀疏率" s=s = s=(计算量 / 满量计算量),"失真度" d=d = d=(稀疏输出与标准输出的 KL 散度 / 均方误差)。稀疏化的核心问题是:在给定 sss 下,最小可能的 ddd 是多少?反过来,在给定 ddd 下,最小可能的 sss 是多少?这是经典的率失真(rate-distortion)问题。

对于注意力算子,理论分析告诉我们:

  • 局部稀疏的率失真曲线:log⁡d∼−αslog⁡n\log d \sim -\alpha s \log nlogd∼−αslogn(多项式关系),其中 α\alphaα 是与窗口大小 www 相关的常数。当 w=O(n)w = O(\sqrt{n})w=O(n​) 时,α≈0.5\alpha \approx 0.5α≈0.5;当 w=O(n0.9)w = O(n^{0.9})w=O(n0.9) 时,α≈0.9\alpha \approx 0.9α≈0.9。这意味着要达到 d<0.01d < 0.01d<0.01,滑动窗口需要 s>0.5s > 0.5s>0.5,即至少半数 token 对都被覆盖。
  • 低秩近似的率失真曲线:log⁡d∼−βlog⁡r\log d \sim -\beta \log rlogd∼−βlogr(rrr 是近似秩),其中 β\betaβ 取决于 softmax 的"秩拉伸"程度。实证上 β≈1\beta \approx 1β≈1,即每提升 1 个数量级的秩,误差下降约 e−1e^{-1}e−1。
  • 哈希稀疏的率失真曲线:介于局部和低秩之间,log⁡d∼−γs\log d \sim -\gamma slogd∼−γs(sss 是桶覆盖比例),γ\gammaγ 与 LSH 投影数量 LLL 相关。增加 LLL 可以降低哈希碰撞率,从而降低失真。

这三类稀疏路径的率失真曲线并不严格可比,因为它们的 sss 度量方式不同(局部稀疏的 sss 是窗口覆盖比,低秩近似的 sss 是秩比,哈希稀疏的 sss 是桶覆盖比)。但我们可以把它们都映射到"有效计算量"(FLOPs per token)这一统一度量上,然后比较在相同 FLOPs 下的 ddd。实证上:在相同 FLOPs 下,混合策略(局部 + 少量全局 + 桶分配)通常优于单一策略。

一个重要的信息论观察是:稀疏化的根本限制不是计算量,而是 softmax 的"信息瓶颈"。softmax 本身是一个有损算子——它把 Rn×n\mathbb{R}^{n \times n}Rn×n 的实数矩阵压缩为每行和为 1 的概率分布,这意味着信息瓶颈约为 log⁡n\log nlogn bit(行归一化损失)。稀疏化进一步损失 log⁡(1/s)\log(1/s)log(1/s) bit(覆盖率损失)。因此总信息瓶颈约为 log⁡n−log⁡s=log⁡(n/s)\log n - \log s = \log(n/s)logn−logs=log(n/s) bit。这一观察提示我们:稀疏化的极限不是"无限稀疏"(s→0s \to 0s→0),而是"在保持 log⁡(n/s)\log(n/s)log(n/s) bit 信息下的最优分配"。

七、频谱分析:稀疏注意力对特征值分布的影响

前述各节已经多次涉及频谱分析,本节系统化地展开。我们把注意力矩阵 AAA 视为非负随机矩阵(每行和为 1,行随机),其特征值 λ1≥λ2≥…≥λn≥0\lambda_1 \geq \lambda_2 \geq \ldots \geq \lambda_n \geq 0λ1​≥λ2​≥…≥λn​≥0 决定了它在长序列上的信息传递性质。具体地,对任意初始信号 xxx,经过 TTT 步 AAA 传播后变为 ATxA^T xATx。若 AAA 的特征值集中在 λ1=1\lambda_1 = 1λ1​=1(主特征值)且其余快速衰减到 0,则 ATxA^T xATx 收敛到主特征向量方向——这是全局信息汇聚。相反,若 AAA 有多个接近 1 的特征值,则 ATxA^T xATx 在多个方向上都有显著分量——这是多尺度信息保留。

标准注意力的频谱:由于 softmax 归一化,AAA 的主特征值 λ1=1\lambda_1 = 1λ1​=1,对应的主特征向量是常数向量(每行和 = 1,所以 A1=1A \mathbf{1} = \mathbf{1}A1=1)。其余特征值 λk\lambda_kλk​(k≥2k \geq 2k≥2)按 softmax 输入的奇异值结构衰减。在自然语言中,λk∼1/k\lambda_k \sim 1/kλk​∼1/k 是常见的频谱衰减曲线。

滑动窗口的频谱:带状矩阵的特征值衰减速率远快于满秩矩阵。具体地,对带宽 www 的 Toeplitz 矩阵,λk∼1/(1+(k/w)2)\lambda_k \sim 1/(1 + (k/w)^2)λk​∼1/(1+(k/w)2)。这意味着前 O(w)O(w)O(w) 个特征值接近 1,第 O(w)O(w)O(w) 之后的特征值快速衰减到接近 0。在 TTT 步传播后,所有 k>O(w)k > O(w)k>O(w) 的信号都被指数级衰减。这与 NIAH 任务的失败模式一致:滑动窗口模型在长度 > www 后就难以传递"needle"信息。

低秩近似的频谱:低秩 A~=LR⊤\tilde{A} = LR^\topA~=LR⊤ 最多有 rank(LR⊤)=r\mathrm{rank}(LR^\top) = rrank(LR⊤)=r 个非零特征值(其余严格为 0)。这意味着原 AAA 的第 r+1r+1r+1 之后的特征值所对应的方向完全消失。在语言建模中,这些方向通常对应长程、低频的语义结构(如段落主题)。Linear Transformer 在长文档摘要任务上的精度下降正是这个频谱截断效应。

哈希稀疏的频谱:哈希稀疏介于前两者之间。桶分配等价于"块对角 + 少量随机连接"的稀疏模式,其特征值分布有"块内强 + 块间弱"的双峰结构。理论上,如果桶分配与真实注意力结构对齐,特征值衰减可以被显著放慢——这是 Routing Transformer 通过学习聚类桶获得收益的根本原因。但若桶分配错位(如训练早期不稳定),特征值衰减会加速到接近滑动窗口的水平。

频谱分析对工程实践的指导意义:在选择稀疏策略时,应根据任务的频谱特性选择。若任务以局部依赖为主(如语法分析、字符级建模),滑动窗口即可;若任务以中等长度依赖为主(如段落级摘要),线性注意力(r≈4dr \approx 4dr≈4d)性价比最高;若任务以长程但离散依赖为主(如问答、NIAH),需要少量全局 token 或分桶策略。

八、长度外推:稀疏结构对 OOD 长度的归纳偏置

长度外推(length generalization)是大模型训练-推理一致性的核心挑战之一:模型在训练长度 LtrainL_{\text{train}}Ltrain​ 上训练,能否在测试长度 Ltest≫LtrainL_{\text{test}} \gg L_{\text{train}}Ltest​≫Ltrain​ 上保持性能?标准 Transformer 在长度外推上有显著缺陷——位置编码(无论是 sinusoidal、learned 还是 RoPE)在超出训练长度后会出现位置混淆或频谱失配,导致困惑度爆炸。稀疏注意力被广泛认为可以改善长度外推,因为它"截断"了超出训练长度的位置交互。

但这种"改善"是有代价的:稀疏化引入的归纳偏置(inductive bias)使得模型在 LtestL_{\text{test}}Ltest​ 上的行为偏离标准注意力。具体地:

滑动窗口的外推性质:在 Ltest>LtrainL_{\text{test}} > L_{\text{train}}Ltest​>Ltrain​ 时,滑动窗口模型自然地"看到" LtrainL_{\text{train}}Ltrain​ 长度的局部窗口 + 多个新窗口。这种结构使得模型学到的局部归纳偏置可以自然外推到更长序列——这是 Longformer 在 4K 训练、32K 推理时仍能保持部分性能的根本原因。但模型从未在训练时见过"两个相距 LtrainL_{\text{train}}Ltrain​ 的 token 之间的直接依赖",因此它无法建模这种长程依赖。

线性注意力的外推性质:由于 ϕ(Q)ϕ(K)⊤\phi(Q)\phi(K)^\topϕ(Q)ϕ(K)⊤ 的计算不依赖于序列长度,理论上可以外推到任意长度。但实际上,Linear Transformer 在 Ltest≫LtrainL_{\text{test}} \gg L_{\text{train}}Ltest​≫Ltrain​ 时仍会出现性能下降——原因是位置编码的截断效应。相对位置编码(如 ALiBi)在线性注意力上比绝对位置编码(sinusoidal)外推更好,但仍非完美。

哈希稀疏的外推性质:哈希桶数量通常与序列长度挂钩(如 n/bn/bn/b 个桶)。在 Ltest≫LtrainL_{\text{test}} \gg L_{\text{train}}Ltest​≫Ltrain​ 时,桶数量增加,桶内密度降低,导致精度下降。Reformer 通过 multi-round LSH 部分缓解,但仍需要保证"分桶质量"在更长序列上不崩。

一个有趣的观察是:位置编码的稀疏化(如 ALiBi)+ 稀疏化机制(如滑动窗口)的组合可以显著改善外推。ALiBi 通过给远处的注意力分数加线性 bias −c∣i−j∣-c|i-j|−c∣i−j∣,使得远处的注意力分数被压制,这天然与滑动窗口的"远处无注意力"假设一致。RoPE 则相反——它通过旋转矩阵让远处的 query-key 仍保持高内积潜力,这与稀疏化机制产生张力。这一观察在 LongLLaMA、CodeLLaMA 等长上下文模型中得到了实证支持。

九、对工程实践的推论:选型决策树与混合稀疏策略

综合前八节的分析,我们给出工程实践中的稀疏注意力选型决策树。

决策树第一层:任务长度

  • n<2Kn < 2Kn<2K:标准注意力,无稀疏化必要(浪费复杂度)
  • 2K<n<8K2K < n < 8K2K<n<8K:滑动窗口 + 全局 token,w=512w=512w=512,全局 token 数 = 任务关键信息 token 数
  • 8K<n<32K8K < n < 32K8K<n<32K:滑动窗口 + 全局 token + RoPE/ALiBi 位置编码;考虑 FlashAttention 等 IO 优化
  • 32K<n<128K32K < n < 128K32K<n<128K:混合策略(局部 + 全局 + 随机块);考虑 Reformer 风格哈希桶
  • n>128Kn > 128Kn>128K:RAG 或 MemWalker 等检索增强架构优先于纯注意力外推

决策树第二层:任务类型

  • 长文档理解(NIAH、QA):滑动窗口 + 全局 token 即可
  • 长文档生成(摘要、续写):线性注意力 + 位置编码插值
  • 长代码理解(变量追溯、函数调用):滑动窗口 + 全局变量 token
  • 长视频/音频字幕:低秩近似 + 时序位置编码

决策树第三层:精度预算

  • 精度损失容忍 < 1%:标准注意力(无稀疏化)
  • 精度损失容忍 1-5%:滑动窗口 + 全局 token / 线性注意力 r=4dr=4dr=4d
  • 精度损失容忍 5-10%:Reformer / Routing Transformer / 强稀疏混合
  • 精度损失容忍 > 10%:RAG + 短上下文

混合稀疏策略:单一稀疏路径通常不能同时满足精度和速度需求。工程上常采用"分层混合"——局部层(如前 6 层)用标准注意力,捕获局部依赖;中间层(如 6-18 层)用滑动窗口 + 全局 token,捕获中等依赖;高层(如 18-24 层)用线性注意力或哈希稀疏,捕获全局依赖。这种分层设计借鉴了 CNN 的多尺度特征金字塔思想,在 BigBird、Mega 等模型中都有体现。

具体到 2026 年的工程现状:Mamba 等状态空间模型(SSM)已经成为"另一种稀疏化路径"——它通过选择性状态空间将注意力复杂度降到 O(n)O(n)O(n),但保留了长程依赖。SSM 与稀疏注意力的关系可以视为"软稀疏"vs"硬稀疏"的对比:SSM 通过选择性机制动态决定哪些历史信息保留在状态中,而稀疏注意力通过预定义模式决定哪些位置参与计算。两者在不同任务上各有优劣。

未来的方向:稀疏注意力的理论统一框架仍在发展中。可能的突破点包括:(1) 基于内容自适应稀疏(content-adaptive sparsity)—— 不使用预定义模式,而是根据 Q,KQ, KQ,K 动态决定稀疏模式;(2) 频谱感知的稀疏化——根据任务的频谱特性自动选择最优稀疏策略;(3) 与 SSM、RWKV 等其他线性复杂度架构的统一理论框架。我们期待 2026-2027 年这些方向能取得突破性进展。


参考文献

  1. Vaswani A, et al. Attention Is All You Need. NeurIPS 2017.
  2. Beltagy I, Peters ME, Cohan A. Longformer: The Long-Document Transformer. arXiv 2020.
  3. Zaheer M, et al. Big Bird: Transformers for Longer Sequences. NeurIPS 2020.
  4. Katharopoulos A, Vyas A, Pappas N, Fleuret F. Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention. ICML 2020.
  5. Choromanski K, et al. Rethinking Attention with Performers. ICLR 2021.
  6. Kitaev N, Kaiser Ł, Levskaya A. Reformer: The Efficient Transformer. ICLR 2020.
  7. Roy A, Saffar M, Vaswani A, Grangier D. Efficient Content-Based Sparse Attention with Routing Transformers. TACL 2021.
  8. Su J, Lu Y, Pan S, Wen B, Liu Y. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing 2024.
  9. Press O, Smith NA, Lewis M. Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. ICLR 2022.
  10. Dao T, Fu DY, Ermon S, Rudra A, Ré C. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness. NeurIPS 2022.
  11. Gu A, Goel K, Ré C. Efficiently Modeling Long Sequences with Structured State Spaces. ICLR 2022.
  12. Mehta H, et al. Long Range Arena: A Benchmark for Efficient Transformers. ICLR 2021.
  13. Tay Y, et al. Efficient Transformers: A Survey. ACM Computing Surveys 2022.
  14. Lin T, et al. A Survey of Transformers. AI Open 2026.

一句话摘要:稀疏注意力机制(局部窗口、低秩近似、哈希桶)的理论统一需要从信息论率失真与频谱分析两个维度切入——局部稀疏擅长保留低频局部依赖但牺牲高频长程信号,低秩近似压缩表示但被 softmax 的秩拉伸效应约束,哈希桶在两者之间通过学习分配逼近最优,三类策略在率失真曲线上各有其位置,工程选型应基于任务长度、任务类型与精度预算的联合决策。

数据局限性说明:本文涉及的稀疏注意力效率数据(如 Performer 4-6 倍加速、Longformer 4K+ 长度支持)基于公开论文与开源实现的实测,截至 2026 年 8 月未有跨厂商统一基准验证;具体速度与精度数据可能随硬件(如 H100 vs A100)、框架(如 FlashAttention 版本)、实现细节(如核函数选择)而有 ±20% 浮动。本文引用的部分最新工作(如基于 SSM 的 Mamba 系列)截至 2026 年 8 月尚处于快速演进期,文中分析可能随新版本发布而过时。

相关文章

  • 大模型隐式压缩的率失真理论 2026:从 KL 散度到最小描述长度的统一信息论框架8月9日
  • 扩散语言模型的离散-连续桥接理论 2026:从吸收态、分数匹配到自回归等价性的统一形式化8月8日
  • MoE 路由理论的形式化 2026:从辅助损失到容量感知8月7日

评论

加载评论中…

发表评论

返回文章列表