稀疏注意力机制的理论统一 2026
约 21 分钟6137 字0 次阅读

一、问题的提出:标准注意力的复杂度瓶颈与稀疏化的动机
Transformer 自 2017 年提出以来,几乎成为序列建模的事实标准架构。其核心组件——缩放点积注意力——在序列长度 上的计算复杂度为 ,内存占用同样为 (在反向传播中存储注意力矩阵)。这意味着当上下文窗口从 2K 扩展到 32K、128K 甚至 1M 时,计算量以平方级增长,显存占用也按平方级膨胀。这个根本性的复杂度瓶颈在过去五年间催生了大量研究工作,试图在保持注意力机制表达能力的同时显著降低其复杂度。
我们把这些工作统称为"稀疏注意力"(sparse attention)机制。但"稀疏"这个词本身具有多种含义:它可以指计算图的稀疏性(只计算部分位置对之间的注意力分数),也可以指表示的稀疏性(用低秩近似压缩注意力矩阵),还可以指结构化的稀疏模式(按预定义的窗口、块或哈希桶进行划分)。本文试图在统一的形式化框架下分析这三种稀疏化路径,从信息论和频谱分析的角度揭示它们的本质联系与权衡。
具体的工程动机包括三个层面:第一,长文档理解(如长 PDF、代码库、长视频字幕)需要远超 8K 上下文才能保留全局依赖;第二,推理成本压缩——128K 上下文的注意力矩阵在 A100 上需要约 64GB 显存(bf16),这远超单卡容量;第三,训练效率提升——稀疏化可以将训练吞吐量提高 3-10 倍,使得在有限算力下能训练更长上下文的模型。然而,稀疏化并非没有代价:它引入了归纳偏置(inductive bias),可能导致模型在某些长程依赖上的建模能力下降。我们需要一套系统化的理论来分析"哪些稀疏模式损失了什么"以及"在哪些任务上损失可接受"。
二、形式化框架:注意力的算子分解与稀疏化的三个轴
我们首先给出标准注意力的算子定义。给定查询矩阵 、键矩阵 、值矩阵 ,标准注意力算子定义为:
其中 softmax 是按行进行的。计算 是 的矩阵乘法,整体算子复杂度为 。我们关心的稀疏化路径可以分解为三个独立的轴:
轴一:计算图稀疏——只对部分 对计算注意力分数,其余位置被 mask 掉(即设 或 )。这包括滑动窗口注意力(Longformer 的局部窗口)、块稀疏(BigBird 的随机块)、哈希桶(Reformer 的 LSH 分桶)。计算复杂度通常降到 或 。
轴二:低秩分解——不计算完整的 注意力矩阵,而是用低秩近似 ,其中 ,。代表工作包括 Performer 的 FAVOR+(基于正交随机特征的核方法)、Linear Transformer 的 分解。计算复杂度可降到 甚至 (若 )。
轴三:混合稀疏——同时利用多个稀疏头组合,每个头采用不同的稀疏模式。如 BigBird 同时使用全局 token、局部窗口和随机连接;Longformer 在局部窗口基础上加入少量全局 token。这是计算图稀疏的扩展。
从算子视角看,这三条路径的目标都是在不同误差度量下逼近标准注意力的输出。具体地,我们可以定义相对误差 ,研究 与稀疏度之间的帕累托前沿。后续章节我们将从几何、数值和信息论三个角度分析这三条路径。
三、局部稀疏:滑动窗口 / Longformer / BigBird 的几何
局部稀疏是工程上最常用、最稳定的稀疏化路径。其核心思想是:假设大部分依赖关系集中在相邻 token 之间,因此只需在局部窗口内计算注意力。具体地,对于位置 ,只计算 范围内的注意力分数,窗口大小 通常为 256、512 或 1024。计算复杂度降为 ,即线性复杂度。Longformer 是该路径的代表作,其滑动窗口头与少量全局头组合,实现了 4096+ 长度的有效建模。
BigBird 进一步扩展了局部稀疏,加入了随机块连接——每个位置额外连接 个随机位置——以增强长程依赖。理论上 BigBird 证明了稀疏注意力是图灵完备的(universal approximation),前提是满足特定稀疏度条件。但实际应用中,BigBird 的随机块通常用预生成的随机种子实现,并非每步重新采样。
从几何视角看,局部稀疏本质上假设注意力矩阵 是带状占优的(banded-dominant),即 是 的单调函数。这一假设在自然语言中部分成立:相邻 token 之间的相关性通常较高,但代词回指("他"、"它")可能跨越长距离。这一假设在代码、JSON 等结构化数据上更弱,因为变量定义与使用可能相隔数百 token。
滑动窗口的频谱性质:我们把注意力矩阵 视为非负行随机矩阵(每行和为 1,因为 softmax),其特征值分布决定了它对长程信号的传递能力。带状矩阵的特征值衰减速率与带宽 呈多项式关系——具体地,对 Toeplitz 类带状矩阵,特征值按 衰减。这意味着滑动窗口能保留前 个特征值所对应的低频成分,但对高频成分(长程交互)会显著衰减。在长文档建模中,这意味着模型更擅长捕获局部语法结构,但对跨章节的主题关联会丢失。
值得注意的工程经验:滑动窗口 + 少量全局 token(如 [CLS]、问题 token)的混合策略在 NIAH(needle-in-a-haystack)任务上表现良好,因为全局 token 充当了"信息中继"——它们在每一层都被所有 token 关注,反向也关注所有 token,从而在带状结构中"跳跃式"传递信息。但全局 token 的数量需要谨慎选择——太少则长程信息传递不足,太多则退化回标准注意力。
四、低秩近似:线性注意力 / Performer / 核方法的频谱分析
低秩稀疏路径的核心思想是用 近似 softmax 核,其中 是一个随机或确定性映射。最简形式是 Linear Transformer(Katharopoulos et al., 2020):,然后利用结合律将 计算顺序改为 ,复杂度从 降为 。当 时仍是线性。
Performer( Choromanski et al., 2021)使用正交随机特征 来无偏估计 softmax 核——即 。当 时,相对误差以高概率控制在 以内。FAVOR+ 算法在 8K 长度上实测比标准注意力快 4-6 倍,精度损失通常 < 1%。
从频谱分析看,低秩近似的核心假设是 softmax 注意力矩阵 的有效秩远小于 。具体地,如果查询-键矩阵 的奇异值衰减快(按指数或多项式),则 也会保留这一性质。在自然语言中,由于词义分布在嵌入空间是低维流形(manifold hypothesis), 和 的有效秩通常为 至 。这解释了为什么 Linear Transformer 在语言建模上能用 取得接近标准注意力的困惑度(perplexity)。
然而,低秩近似有一个根本限制:它假设注意力矩阵是低秩的,但忽略了 softmax 归一化对秩的拉伸效应。具体地,softmax 把任意输入矩阵的行归一化为概率分布,这一过程倾向于增加矩阵的有效秩(因为每行和约束减少了秩自由度)。理论与实证上,softmax 之后的注意力矩阵的秩通常比 softmax 之前高 1-2 个数量级。这意味着低秩近似需要 才能精确逼近 softmax 输出,远超 Linear Transformer 的 设置。这是 Linear Transformer 在某些长程任务上表现欠佳的根本原因。
核方法的随机特征理论告诉我们:为了达到 相对误差,FAVOR+ 需要 个特征。当 时 ,这远超实际可用维度。因此实际部署的 Linear Transformer()是用更大误差换取了速度,而非真正无偏估计 softmax 核。
五、哈希稀疏:Routing Transformer / Reformer / 桶分配
哈希稀疏路径通过哈希函数将相似的查询-键对分配到同一桶中,只在桶内计算注意力。Reformer(Kitaev et al., 2020)使用位置敏感哈希(LSH)将 通过随机超平面投影后分桶,理论上同桶内的 query-key 对大概率有高注意力分数。桶大小通常设为 ,桶数量 ,总计算 。Routing Transformer(Roy et al., 2021)使用学习的聚类(k-means)替代 LSH,桶分配更稳定但需要额外训练。
从几何视角看,哈希稀疏本质上把注意力矩阵 在"查询空间"上进行聚类划分。LSH 的理论性质是:对于查询 和键 ,若 大(即 是 的相关 key),则 和 高概率被分到同一桶。这是 locality-sensitive hashing 的标准保证(Indyk-Motwani 1998)。但是,LSH 保证的是"高内积高概率同桶",不保证"低内积低概率同桶"——即哈希有 recall 偏向,桶内可能含有许多不相关的 key,导致桶内 softmax 仍需要精细选择 top-。
实际工程上,Routing Transformer 和 Reformer 都采用"分桶 + 桶内 top-"的两阶段策略:第一阶段粗筛(同桶),第二阶段细筛(桶内 top-)。这进一步将复杂度从 降到 , 通常为 32-64。两阶段策略的频谱性质是:第一阶段保留高能量成分(与 LSH 的高内积保证一致),第二阶段过滤桶内低能量成分(softmax 的稀疏性)。两步叠加可以逼近原矩阵的前 个奇异值所对应的低秩结构。
哈希稀疏的主要挑战是桶分配的稳定性:训练中查询-键分布在变化,导致同一对 可能跨阶段被分到不同桶(bucket reshuffle)。Reformer 通过 multi-round LSH(每一层用不同的 LSH 投影)部分缓解,但增加了常数倍计算。Routing Transformer 通过 k-means 周期性更新聚类中心来稳定桶分配,但每 k 步需要一次额外的前向传播用于聚类。这种"桶分配不稳定 + 周期性重聚类"的工程开销是哈希稀疏的实际部署瓶颈。
六、信息论统一视角:稀疏性的率失真上界
前述三种稀疏路径虽然具体机制不同,但都可以从信息论角度统一分析。我们定义"稀疏率" (计算量 / 满量计算量),"失真度" (稀疏输出与标准输出的 KL 散度 / 均方误差)。稀疏化的核心问题是:在给定 下,最小可能的 是多少?反过来,在给定 下,最小可能的 是多少?这是经典的率失真(rate-distortion)问题。
对于注意力算子,理论分析告诉我们:
- 局部稀疏的率失真曲线:(多项式关系),其中 是与窗口大小 相关的常数。当 时,;当 时,。这意味着要达到 ,滑动窗口需要 ,即至少半数 token 对都被覆盖。
- 低秩近似的率失真曲线:( 是近似秩),其中 取决于 softmax 的"秩拉伸"程度。实证上 ,即每提升 1 个数量级的秩,误差下降约 。
- 哈希稀疏的率失真曲线:介于局部和低秩之间,( 是桶覆盖比例), 与 LSH 投影数量 相关。增加 可以降低哈希碰撞率,从而降低失真。
这三类稀疏路径的率失真曲线并不严格可比,因为它们的 度量方式不同(局部稀疏的 是窗口覆盖比,低秩近似的 是秩比,哈希稀疏的 是桶覆盖比)。但我们可以把它们都映射到"有效计算量"(FLOPs per token)这一统一度量上,然后比较在相同 FLOPs 下的 。实证上:在相同 FLOPs 下,混合策略(局部 + 少量全局 + 桶分配)通常优于单一策略。
一个重要的信息论观察是:稀疏化的根本限制不是计算量,而是 softmax 的"信息瓶颈"。softmax 本身是一个有损算子——它把 的实数矩阵压缩为每行和为 1 的概率分布,这意味着信息瓶颈约为 bit(行归一化损失)。稀疏化进一步损失 bit(覆盖率损失)。因此总信息瓶颈约为 bit。这一观察提示我们:稀疏化的极限不是"无限稀疏"(),而是"在保持 bit 信息下的最优分配"。
七、频谱分析:稀疏注意力对特征值分布的影响
前述各节已经多次涉及频谱分析,本节系统化地展开。我们把注意力矩阵 视为非负随机矩阵(每行和为 1,行随机),其特征值 决定了它在长序列上的信息传递性质。具体地,对任意初始信号 ,经过 步 传播后变为 。若 的特征值集中在 (主特征值)且其余快速衰减到 0,则 收敛到主特征向量方向——这是全局信息汇聚。相反,若 有多个接近 1 的特征值,则 在多个方向上都有显著分量——这是多尺度信息保留。
标准注意力的频谱:由于 softmax 归一化, 的主特征值 ,对应的主特征向量是常数向量(每行和 = 1,所以 )。其余特征值 ()按 softmax 输入的奇异值结构衰减。在自然语言中, 是常见的频谱衰减曲线。
滑动窗口的频谱:带状矩阵的特征值衰减速率远快于满秩矩阵。具体地,对带宽 的 Toeplitz 矩阵,。这意味着前 个特征值接近 1,第 之后的特征值快速衰减到接近 0。在 步传播后,所有 的信号都被指数级衰减。这与 NIAH 任务的失败模式一致:滑动窗口模型在长度 > 后就难以传递"needle"信息。
低秩近似的频谱:低秩 最多有 个非零特征值(其余严格为 0)。这意味着原 的第 之后的特征值所对应的方向完全消失。在语言建模中,这些方向通常对应长程、低频的语义结构(如段落主题)。Linear Transformer 在长文档摘要任务上的精度下降正是这个频谱截断效应。
哈希稀疏的频谱:哈希稀疏介于前两者之间。桶分配等价于"块对角 + 少量随机连接"的稀疏模式,其特征值分布有"块内强 + 块间弱"的双峰结构。理论上,如果桶分配与真实注意力结构对齐,特征值衰减可以被显著放慢——这是 Routing Transformer 通过学习聚类桶获得收益的根本原因。但若桶分配错位(如训练早期不稳定),特征值衰减会加速到接近滑动窗口的水平。
频谱分析对工程实践的指导意义:在选择稀疏策略时,应根据任务的频谱特性选择。若任务以局部依赖为主(如语法分析、字符级建模),滑动窗口即可;若任务以中等长度依赖为主(如段落级摘要),线性注意力()性价比最高;若任务以长程但离散依赖为主(如问答、NIAH),需要少量全局 token 或分桶策略。
八、长度外推:稀疏结构对 OOD 长度的归纳偏置
长度外推(length generalization)是大模型训练-推理一致性的核心挑战之一:模型在训练长度 上训练,能否在测试长度 上保持性能?标准 Transformer 在长度外推上有显著缺陷——位置编码(无论是 sinusoidal、learned 还是 RoPE)在超出训练长度后会出现位置混淆或频谱失配,导致困惑度爆炸。稀疏注意力被广泛认为可以改善长度外推,因为它"截断"了超出训练长度的位置交互。
但这种"改善"是有代价的:稀疏化引入的归纳偏置(inductive bias)使得模型在 上的行为偏离标准注意力。具体地:
滑动窗口的外推性质:在 时,滑动窗口模型自然地"看到" 长度的局部窗口 + 多个新窗口。这种结构使得模型学到的局部归纳偏置可以自然外推到更长序列——这是 Longformer 在 4K 训练、32K 推理时仍能保持部分性能的根本原因。但模型从未在训练时见过"两个相距 的 token 之间的直接依赖",因此它无法建模这种长程依赖。
线性注意力的外推性质:由于 的计算不依赖于序列长度,理论上可以外推到任意长度。但实际上,Linear Transformer 在 时仍会出现性能下降——原因是位置编码的截断效应。相对位置编码(如 ALiBi)在线性注意力上比绝对位置编码(sinusoidal)外推更好,但仍非完美。
哈希稀疏的外推性质:哈希桶数量通常与序列长度挂钩(如 个桶)。在 时,桶数量增加,桶内密度降低,导致精度下降。Reformer 通过 multi-round LSH 部分缓解,但仍需要保证"分桶质量"在更长序列上不崩。
一个有趣的观察是:位置编码的稀疏化(如 ALiBi)+ 稀疏化机制(如滑动窗口)的组合可以显著改善外推。ALiBi 通过给远处的注意力分数加线性 bias ,使得远处的注意力分数被压制,这天然与滑动窗口的"远处无注意力"假设一致。RoPE 则相反——它通过旋转矩阵让远处的 query-key 仍保持高内积潜力,这与稀疏化机制产生张力。这一观察在 LongLLaMA、CodeLLaMA 等长上下文模型中得到了实证支持。
九、对工程实践的推论:选型决策树与混合稀疏策略
综合前八节的分析,我们给出工程实践中的稀疏注意力选型决策树。
决策树第一层:任务长度
- :标准注意力,无稀疏化必要(浪费复杂度)
- :滑动窗口 + 全局 token,,全局 token 数 = 任务关键信息 token 数
- :滑动窗口 + 全局 token + RoPE/ALiBi 位置编码;考虑 FlashAttention 等 IO 优化
- :混合策略(局部 + 全局 + 随机块);考虑 Reformer 风格哈希桶
- :RAG 或 MemWalker 等检索增强架构优先于纯注意力外推
决策树第二层:任务类型
- 长文档理解(NIAH、QA):滑动窗口 + 全局 token 即可
- 长文档生成(摘要、续写):线性注意力 + 位置编码插值
- 长代码理解(变量追溯、函数调用):滑动窗口 + 全局变量 token
- 长视频/音频字幕:低秩近似 + 时序位置编码
决策树第三层:精度预算
- 精度损失容忍 < 1%:标准注意力(无稀疏化)
- 精度损失容忍 1-5%:滑动窗口 + 全局 token / 线性注意力
- 精度损失容忍 5-10%:Reformer / Routing Transformer / 强稀疏混合
- 精度损失容忍 > 10%:RAG + 短上下文
混合稀疏策略:单一稀疏路径通常不能同时满足精度和速度需求。工程上常采用"分层混合"——局部层(如前 6 层)用标准注意力,捕获局部依赖;中间层(如 6-18 层)用滑动窗口 + 全局 token,捕获中等依赖;高层(如 18-24 层)用线性注意力或哈希稀疏,捕获全局依赖。这种分层设计借鉴了 CNN 的多尺度特征金字塔思想,在 BigBird、Mega 等模型中都有体现。
具体到 2026 年的工程现状:Mamba 等状态空间模型(SSM)已经成为"另一种稀疏化路径"——它通过选择性状态空间将注意力复杂度降到 ,但保留了长程依赖。SSM 与稀疏注意力的关系可以视为"软稀疏"vs"硬稀疏"的对比:SSM 通过选择性机制动态决定哪些历史信息保留在状态中,而稀疏注意力通过预定义模式决定哪些位置参与计算。两者在不同任务上各有优劣。
未来的方向:稀疏注意力的理论统一框架仍在发展中。可能的突破点包括:(1) 基于内容自适应稀疏(content-adaptive sparsity)—— 不使用预定义模式,而是根据 动态决定稀疏模式;(2) 频谱感知的稀疏化——根据任务的频谱特性自动选择最优稀疏策略;(3) 与 SSM、RWKV 等其他线性复杂度架构的统一理论框架。我们期待 2026-2027 年这些方向能取得突破性进展。
参考文献
- Vaswani A, et al. Attention Is All You Need. NeurIPS 2017.
- Beltagy I, Peters ME, Cohan A. Longformer: The Long-Document Transformer. arXiv 2020.
- Zaheer M, et al. Big Bird: Transformers for Longer Sequences. NeurIPS 2020.
- Katharopoulos A, Vyas A, Pappas N, Fleuret F. Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention. ICML 2020.
- Choromanski K, et al. Rethinking Attention with Performers. ICLR 2021.
- Kitaev N, Kaiser Ł, Levskaya A. Reformer: The Efficient Transformer. ICLR 2020.
- Roy A, Saffar M, Vaswani A, Grangier D. Efficient Content-Based Sparse Attention with Routing Transformers. TACL 2021.
- Su J, Lu Y, Pan S, Wen B, Liu Y. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing 2024.
- Press O, Smith NA, Lewis M. Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. ICLR 2022.
- Dao T, Fu DY, Ermon S, Rudra A, Ré C. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness. NeurIPS 2022.
- Gu A, Goel K, Ré C. Efficiently Modeling Long Sequences with Structured State Spaces. ICLR 2022.
- Mehta H, et al. Long Range Arena: A Benchmark for Efficient Transformers. ICLR 2021.
- Tay Y, et al. Efficient Transformers: A Survey. ACM Computing Surveys 2022.
- Lin T, et al. A Survey of Transformers. AI Open 2026.
一句话摘要:稀疏注意力机制(局部窗口、低秩近似、哈希桶)的理论统一需要从信息论率失真与频谱分析两个维度切入——局部稀疏擅长保留低频局部依赖但牺牲高频长程信号,低秩近似压缩表示但被 softmax 的秩拉伸效应约束,哈希桶在两者之间通过学习分配逼近最优,三类策略在率失真曲线上各有其位置,工程选型应基于任务长度、任务类型与精度预算的联合决策。
数据局限性说明:本文涉及的稀疏注意力效率数据(如 Performer 4-6 倍加速、Longformer 4K+ 长度支持)基于公开论文与开源实现的实测,截至 2026 年 8 月未有跨厂商统一基准验证;具体速度与精度数据可能随硬件(如 H100 vs A100)、框架(如 FlashAttention 版本)、实现细节(如核函数选择)而有 ±20% 浮动。本文引用的部分最新工作(如基于 SSM 的 Mamba 系列)截至 2026 年 8 月尚处于快速演进期,文中分析可能随新版本发布而过时。