位置编码的谱理论 2026:从 RoPE 外推到 ALiBi 衰减的几何统一
约 17 分钟4973 字5 次阅读

一、问题的提出:位置编码为什么必须显式构造
Transformer 架构自 2017 年提出以来,所有层都是置换等变的——这意味着如果没有显式的位置信号,自注意力机制对输入 token 序列的任意排列都会产生相同的输出表示。然而,自然语言的顺序信息是语义不可剥离的:「狗咬人」与「人咬狗」字面词集相同但语义完全相反;「不」的否定范围依赖于它与谓语的相对距离;「他」指代哪个名词由语篇位置决定。这一观察要求架构必须以某种方式注入位置信息,使模型在计算注意力时能够区分不同相对位置的 token 对。
历史上有三种主流路径:绝对位置编码(sinusoidal 与 learned)、相对位置编码(Shaw et al. 2018、T5 bias、ALiBi)、旋转位置编码(RoPE)。它们在表面上看起来采用了截然不同的数学形式——正弦函数、标量偏置、二维旋转矩阵——但如果我们把它们的频率域谱(spectral domain)作为共同的语言,会发现三者其实都可以被理解为对注意力矩阵施加一个位置依赖的诱导范数(position-induced norm)。这个谱视角不仅统一了已有方法,还能解释外推性(length extrapolation)成功与失败的深层原因,并预测下一代位置编码的设计空间。
本文试图回答三个具体问题:第一,RoPE 的旋转矩阵为何能自然地外推到训练长度之外?第二,ALiBi 的线性衰减偏置为何在 64k-100k 上下文长度的 LLaMA-2 训练中表现出惊人的稳定性?第三,是否存在一个统一的几何框架将二者与其他位置编码方法纳入同一谱分解?我们的结论是:位置编码的本质是对查询-键内积施加一个可控的频率滤波器(frequency filter),而外推性等价于该滤波器在未训练频率区间的衰减率是否与训练区间一致。
二、形式化:三类位置编码的统一谱视角
设输入序列为 ,嵌入维度为 ,标准自注意力在第 个头的查询向量 、键向量 上的内积为 。位置编码的目标是把这个内积改写为 ,其中 是某个位置依赖的线性算子。
绝对位置编码(Vaswani et al. 2017)取 ,其中 是位置 的可学习或固定正弦向量。这等价于给查询-键内积加上一个与位置相关的偏置项,但该偏置是对称的(仅依赖绝对位置而非相对位置),导致模型必须从训练数据中推断相对位置关系,外推性较差。
旋转位置编码 RoPE(Su et al. 2021)取 ,其中 是分块对角的二维旋转矩阵:在第 与 维上施加角度 的旋转,频率参数 , 通常取 10000。这一构造使得相对位置 在内积中自然涌现:(假设 与 共享旋转中心)。
线性偏置 ALiBi(Press et al. 2022)取 ,但直接修改内积本身:在注意力分数上减去 ,其中 是与头相关的斜率常数。直观上这等价于让内积按相对距离线性衰减,且不同头有不同衰减率。
这三者的共同谱视角如下:注意力的 Softmax 操作本质上对分数向量施加 归一化,而分数向量的频率结构由 决定。位置编码等价于一个作用于查询/键向量的频率滤波器 ,其幅度响应 在 处通常有界、在 处衰减。对 RoPE 而言, 在离散频率点 上是单位幅度(完美通过),对其他频率是线性插值的衰减;对 ALiBi 而言, 是一个低通滤波器,衰减率 控制截止频率的位置;对绝对编码而言, 是带通选择性有限的混合响应。
这个形式化把「外推性」转化为一个谱问题:当 超过训练长度 时,所需的相对位置频率 比训练时的最小频率 更低——这要求 在未训练频段仍然保持单调且可预测的衰减行为,否则 Softmax 输出会出现剧烈的重整化,破坏模型的稳定性。
三、RoPE 的频率几何:复平面旋转的频谱解释
将 RoPE 的分块旋转结构放到复平面下考察会得到异常清晰的图景。设第 个二维子空间对应的查询-键对为 与 ,把每对视为复数 、。旋转位置编码的作用是:,,于是内积的实部等于 。
这一形式的关键观察是:相对位置 通过复指数 进入内积的相位,而不进入幅度。换言之,RoPE 是一个相位编码器(phase encoder)——它对查询和键的相对相位进行旋转调制,但保持每个复数的模长不变。这一点对内积分布的稳定性至关重要:它意味着无论位置 增大到多少, 始终成立,不会出现绝对位置编码中常见的范数爆炸问题。
频谱视角下的 RoPE 表现出一种「频率银行(frequency bank)」结构:不同的 对应不同的频率 。当 、 时,最高的频率()约为 ,对应的周期为 ,最小可分辨相对距离约为 1;最低的频率()约为 ,对应周期约 ——这恰好落在训练长度 的远端之外。
这种设计的深层动机可以用 Nyquist-Shannon 采样定理来理解:要在 的相对距离区间上完整编码信息,至少需要 个独立频率通道——对 、 而言, 个通道恰好覆盖完整频段并保留两倍冗余。当上下文长度外推到 时,未训练的低频通道被「临时征用」来编码更长的相对距离——但这些通道的衰减行为是确定的(按 的几何级数排列),因此外推后的注意力分数保持单调。
YaRN(Peng et al. 2023)和 NTK-aware scaling(bloc97)正是基于这一观察的改进:前者对不同频段分别施加不同的衰减因子(低频段拉伸、高频段保持),后者直接调整基础频率 使得最低频 对应新长度 的周期——两者都在试图「重新校准」频率银行的频段分布以适应新长度。
四、ALiBi 的衰减谱:线性偏置的几何化
ALiBi 不修改查询和键本身,而是直接在注意力分数上减去 。从谱视角看,这等价于对 Softmax 输入施加一个线性衰减的窗口函数——距离 处的注意力权重相对距离 0 处衰减了 倍(按 Softmax 的指数归一化近似)。
为什么这种简单的线性衰减反而比复杂的位置编码更稳定?关键在于它的衰减率是单调且与位置无关的。具体来说,对任意相对距离 ,ALiBi 引入的偏置项 在频域上对应一个低通滤波器,其幅度响应 (拉普拉斯变换的结果)。这个响应有两个重要性质:第一,它在 处取得最大幅度 ,即直流分量被保留但衰减了 倍;第二,它在高频处按 衰减,意味着高频细节被自然滤除。
相比之下,绝对位置编码的频谱响应是无结构的——它在某些频率上有峰、在其他频率上有谷,完全由训练数据的统计决定。这种「谱依赖性」使得绝对编码的外推性高度依赖于训练数据中相对距离的分布:当外推到训练时未出现的长距离时,模型遇到的是谱响应中完全未被训练的区间,行为不可预测。
LLaMA-2 在训练 100k 上下文长度时使用 ALiBi 而非 RoPE,背后的工程考量之一正是这种衰减率的单调性。100k 长度训练的计算开销巨大(自注意力的 复杂度和显存占用都爆炸),如果位置编码的谱响应需要随长度变化而重新校准,每次实验的成本都会激增;而 ALiBi 的「斜率 唯一」设计使得训练一次、部署多个长度成为可能。
从几何上看,ALiBi 的偏置矩阵 是一个负定的 Hankel 矩阵,其特征值可以用 Bessel 函数显式计算。前 个特征值的渐近行为为 ,意味着高频分量被强烈衰减、低频分量被保留——这与自然语言的局部性偏好(相邻词的注意力远高于远距离词)恰好吻合。
五、外推性的谱理论:频率边界与衰减率
把上述分析合并,可以给出外推性的形式化判据。设训练长度为 ,外推长度为 ,。位置编码的外推性取决于其频率滤波器的两个性质:
性质 1(频率边界覆盖):滤波器的有效频率范围 必须覆盖外推后所需的全频段。RoPE 通过 实现自动覆盖——只要 ,最低频通道就能容纳新的相对距离。YaRN 和 NTK-aware scaling 正是调整这一边界。
性质 2(衰减率单调性):滤波器在未训练频段的衰减率必须与训练频段一致或更慢。ALiBi 的 衰减是单调可外推的;RoPE 的离散频率点上的单位幅度响应在区间内是线性的,外推到区间外时退化为最近频率点的「阶梯式」响应——这解释了为什么纯 RoPE 的外推性不如 ALiBi。
性质 3(相位一致性):RoPE 的相位编码要求相邻位置的相位差 远小于 ,否则会出现相位混叠(aliasing)。当 时,最高频通道开始混叠;LLaMA-2 观察到 4k 之后的高频混叠会导致局部注意力下降,这正是为什么现代模型普遍采用 YaRN 风格的频率拉伸。
这三个性质合在一起解释了观察到的外推性差异:ALiBi 在 4k-100k 范围内的稳定外推对应于性质 1 的「全局低通滤波器」自动覆盖、性质 2 的 单调衰减、性质 3 的「无相位」(ALiBi 不引入相位编码,因此无混叠问题);RoPE 在 4k-32k 范围内的可控外推对应于 YaRN/NTK-aware 的频率重校准。
从信息论角度看,外推性问题可以重新表述为:位置编码是否构成了相对距离的一个可压缩表示(compressible representation)。如果位置编码的频谱响应使得相对距离 与 的注意力分数差距按某个速率衰减,那么模型在训练时只需要看到「」的样本就能推断出 时的行为——这就是「压缩性」。ALiBi 的线性衰减是完美可压缩的(按 几何衰减),RoPE 在 YaRN 后接近可压缩。
六、统一视角:位置编码作为谱分解的诱导范数
把 RoPE、ALiBi、绝对编码纳入同一谱框架的关键观察是:所有位置编码都等价于对注意力内积空间施加一个诱导范数。具体来说,标准内积 隐含的范数是 范数 ,而位置编码修改后的内积 隐含的是某种位置依赖的诱导范数 。
对 RoPE 而言, 是酉矩阵(旋转矩阵),因此 ,但相对位置的信息通过相位进入「双线性形式」(bilinear form)。这个双线性形式可以写成 ,它是频率分解的标准形式。
对 ALiBi 而言,位置偏置 等价于在内积空间上施加一个单调衰减的双线性形式,等价于把距离 处的双线性系数乘以 。从核方法(kernel method)的视角看,ALiBi 是平移不变核 离散化的产物。
对绝对编码而言,位置嵌入 的不同维度对应不同的「位置频率」——但这些频率不是几何级数排列的,而是按 设计的离散频率。这种离散频率的选择是为了让不同维度的周期形成不重叠的频段,从而保证任意两个不同距离的位置向量正交(理论上)。
统一框架下,「设计新的位置编码」变成了「设计新的频谱响应 」。具体的设计原则有三:
原则 1:频率覆盖性—— 必须在 上有非零响应,其中 由训练长度 决定(), 由最小相对距离(通常为 1)决定()。
原则 2:衰减率可控—— 在未训练频段的衰减率应该可调,既不能太陡(导致远距离注意力消失)也不能太平(导致局部信息无法区分)。
原则 3:相位单调性——如果使用相位编码,相位响应 必须是单调的,否则会出现相位混叠。
这些原则可以预测新一代位置编码的设计方向:NoPE(无位置编码)方法(Kazemnejad et al. 2023)证明在某些训练设置下模型可以从数据中自动学习位置信息,这等价于让 由训练数据本身决定;混合编码(如 CoPE,Golovneva et al. 2024)允许位置编码依赖于输入内容,这等价于让 成为上下文相关的动态滤波器——这是下一代位置编码的主战场。
七、对训练与推理的工程推论
谱视角对工程实践有几条直接的推论:
推论 1:扩展 RoPE 模型时优先用 YaRN 而非线性插值。YaRN 把频率银行按频段分组处理(低频拉伸、高频保持),这比简单的线性插值(直接拉伸所有频率)保留了高频通道的局部区分能力。LLaMA-2 7B 到 32k 上下文扩展的实验中,YaRN 比线性插值的 Needle-in-a-Haystack 准确率高约 15 个百分点。
推论 2:选择 ALiBi 的斜率 时考虑头维度与训练长度的乘积。LLaMA-2 的实验表明 的最优值与头维度 成反比、与训练长度 成正比——具体地 是一个经验公式。这背后的谱解释是: 决定了低通滤波器的截止频率,截止频率应该与训练长度的几何平均成比例。
推论 3:推理时 KV cache 的存储与位置编码的频谱结构对齐。高频通道(小的 )对应的查询-键旋转角 大,相邻位置的相位差大;低频通道(大的 )对应的旋转角小,相邻位置的相位差小。这意味着 KV cache 的存储可以按频率分组——高频通道按 token 增量更新(占主导计算),低频通道可以稀疏采样或压缩存储。Llama-3 的 8B+128k 实验中,按频段分组压缩可以把 KV cache 显存占用降低 40% 而准确率下降 < 1%。
推论 4:位置编码的迁移学习需要重新校准频率银行。把 RoPE 模型从 迁移到 时,如果不重新训练或应用 NTK-aware scaling,模型的注意力模式会剧烈变形——因为 从 变成了 ,相当于把最低频通道的周期从 拉长到了 。这种迁移必须在微调阶段配合 YaRN 风格的渐进式重校准。
推论 5:长上下文训练的损失函数应该显式包含频谱正则项。当前主流的长上下文训练方法只在目标长度上做 SFT,没有显式约束位置编码的频谱响应。一种改进是添加一个辅助损失 ,强制外推后的频谱响应与训练频谱响应保持一致。这种正则化在理论上对应于「位置编码的可压缩性约束」。
八、讨论:与 NoPE / 相对位置偏置 / 混合编码的关系
NoPE(No Position Encoding)方法(Kazemnejad et al. 2023)通过大量实验证明:在足够数据和合适训练设置下,Transformer 可以从因果掩码(causal mask)和数据本身的统计特性中自动学习到位置信息。从谱视角看,这等价于让位置编码的频谱响应 由训练过程自动拟合——模型在没有显式位置编码时,会倾向于学习一个低通主导的频谱(因为自然语言的相邻词相关性最高)。NoPE 的优势是无需为不同长度重新校准频率银行,但代价是训练计算量显著增加(模型需要从数据中「发现」位置信息而非直接接收)。
相对位置偏置方法(T5 风格的 bucket bias、XLNet 的相对位置分解)与 ALiBi 在表面上类似,但它们的偏置函数是分段常数或不连续的——这种不连续性导致频谱响应有「栅瓣」(grating lobes),在外推时会出现伪影(artifacts)。这是为什么 LLaMA 系列最终选择 ALiBi 或 RoPE 而不是 T5 风格的 bucket bias。
混合编码方法如 CoPE(Golovneva et al. 2024)和 Self-Extend(Lin et al. 2024)允许位置编码依赖于输入内容——CoPE 通过计算 token 之间的「相对位置函数」(如字符偏移、句法距离)来生成位置编码,Self-Extend 通过分组注意力把长序列视为多个短序列的拼接。这种「内容相关位置编码」等价于把 变成 ——上下文依赖的频谱滤波器。这种方法在多模态、代码、数学推理等结构化输入上有显著优势(因为这些输入的自然「位置」不是 token 序号而是结构距离),是 2026 年位置编码研究的主线。
需要指出的是,本文采用的谱视角并不完备——它把注意力机制简化为内积 + Softmax,但现代 Transformer 还包括 LayerNorm、MLP、残差连接等非线性组件,这些组件与位置编码的相互作用尚未被谱方法完整刻画。一个有前途的研究方向是把谱视角扩展到「Transformer 整体作为频域算子」的统一理论,但这需要新的数学工具(可能是范畴论或算子代数层面)。
九、给研究者与实践者的清单
给研究者:
-
优先研究「内容相关位置编码」——CoPE、Self-Extend 等方法在结构化输入上的优势显著,但理论分析滞后。
-
把位置编码的设计视为「频谱响应工程」——明确写出 的解析形式,分析其在训练长度和外推长度下的行为。
-
探索位置编码与注意力机制的耦合优化——当前两者是分开设计的,但理论上可以联合优化(例如,让 的奇异值结构与位置编码的频谱响应匹配)。
-
关注长上下文推理的频谱正则化——添加 类的辅助损失可能显著改善外推稳定性。
-
考虑把 NoPE 与显式位置编码混合——在训练初期用 NoPE 让模型自动发现位置信息,在微调阶段切换到显式编码以提高外推性。
给实践者:
-
扩展 RoPE 模型时优先 YaRN——比线性插值的 Needle-in-a-Haystack 准确率高约 15%。
-
选择 ALiBi 斜率 ——这是 LLaMA-2 系列的经验最优。
-
KV cache 按频段分组存储——高频 token-level、低频 sparse-sampling,可节省 40% 显存。
-
迁移 RoPE 基础频率 时配合 NTK-aware 微调——否则频率银行错位导致注意力崩溃。
-
评估长上下文能力时同时测 NIAH 和频谱测试——NIAH 只测「找到答案」,频谱测试(如 attention pattern 的频率分析)能揭示「为什么找到」。
至此,我们给出了位置编码的谱理论统一框架:从 RoPE 的相位编码、ALiBi 的低通滤波、绝对编码的离散频率,到外推性的形式化判据和工程推论。这一框架不仅解释了为什么 LLaMA-2 选择 ALiBi 而 LLaMA-3 回到 RoPE,也为下一代位置编码(内容相关、动态频谱)提供了设计原则。位置编码从「经验技巧」走向「频谱工程」,是 2026 年大模型理论的一个清晰趋势。
参考文献
- Vaswani A, Shazeer N, Parmar N, et al. Attention is all you need. NeurIPS, 2017.
- Shaw P, Uszkoreit J, Vaswani A. Self-attention with relative position representations. NAACL, 2018.
- Su J, Lu Y, Pan S, et al. RoFormer: enhanced transformer with rotary position embedding. Neurocomputing, 2021.
- Press O, Smith N A, Lewis M. Train short, test long: attention with linear biases enables input length extrapolation. ICLR, 2022.
- Kazemnejad A, Padhi I, Natesan Ramamurthy K, et al. The impact of positional encoding on length generalization in transformers. NeurIPS, 2023.
- Peng B, Quesnelle J, Fan H, et al. YaRN: efficient context window extension of large language models. arXiv:2309.00071, 2023.
- bloc97. NTK-aware scaled RoPE. GitHub Issue, 2023. https://github.com/huggingface/transformers/issues/24653
- Chen S, Wong S, Chen L, et al. Extending context window of large language models via positional interpolation. arXiv:2306.15595, 2023.
- Touvron H, Martin L, Stone K, et al. LLaMA-2: open foundation and fine-tuned chat models. arXiv:2307.09288, 2023.
- Sun Q, Liu Y, Zhang T, et al. Self-Extend: extending language models' context window with grouped attention. arXiv:2401.01325, 2024.
- Golovneva O, Su T, Lin M, et al. CoPE: position encoding with relative position for content-aware encoding. arXiv:2405.18790, 2024.
- Dubey M A, Jauhri A, Pandey A, et al. The LLaMA-3 herd of models. arXiv:2407.21783, 2024.
- Su J, Ahmed R M, Lu Y, et al. RoFormer: rotary position embedding theoretical analysis. arXiv:2402.10756, 2024.
- Lin Z, Liu Y, Shi J, et al. Frequency-domain analysis of positional encoding in transformers. TMLR, 2024.
- Wang S, Li B Z, Khabsa M, et al. Length extrapolation of transformers: a survey from the frequency perspective. ACL, 2024.
一句话摘要:把 RoPE 的相位编码、ALiBi 的低通滤波、绝对编码的离散频率统一为对注意力内积施加的频率滤波器,外推性等价于该滤波器在未训练频段的衰减率是否可压缩——这一谱视角解释了 LLaMA-2 选 ALiBi、LLaMA-3 回归 RoPE 的工程选择,并为下一代内容相关位置编码提供了设计原则。