后训练阶段的保留-习得张力理论 2026:从弹性权重固化到策略空间几何的权衡几何学
一句话摘要:在 RLHF / DPO / GRPO / RLVR 主导的后训练时代,模型必须在"保留预训练知识"与"习得新偏好技能"之间走一条越来越窄的钢丝;本文用弹性权重固化(EWC)的 Fisher 信息几何推广到策略空间,给出"保留-习得张力"的形式化定义,并证明 GRPO 的 KL 锚点本质上是这一张力在策略流形上的最优 Pareto 前沿的一个稳定点。
一、问题的提出:当对齐开始擦除预训练
2025-2027 年是大模型后训练范式从 RLHF 走向 DPO、GRPO、RLVR 的关键窗口期。表面上,对齐技术让我们在指令跟随、推理、安全、长上下文一致性上都取得了肉眼可见的进步;但一个被反复掩盖的问题逐渐浮出水面:对齐训练会让模型"遗忘"预训练阶段学到的世界知识 。
这个问题在三个层面同时显现。第一个层面是经验层面:Anthropic、DeepMind、Meta 的对齐团队在内部评估中反复报告"对齐税"(alignment tax)——模型在对齐后指令跟随能力提升的同时,标准 MMLU、ARC、HellaSwag 等知识与推理基准会出现 2-7 个百分点的回退。第二个层面是产品层面:用户能直接感受到"对齐过"的模型在写代码、读论文、做数学证明时"比以前笨了"——这种现象在以 GPT-3.5 到 GPT-4 的过渡期尤为明显,社区称之为"对齐税"或"对齐痴呆"。第三个层面是理论层面:当我们用 KL 散度约束策略不要偏离参考策略太远时,本质上是在做正则化 ;但正则化强度和学习率、batch size、训练步数耦合在一起,导致最终的"保留度"和"习得度"变成一个无法解析控制的隐式权衡。
本文要回答的核心问题是:这条"保留-习得"钢丝的几何形状是什么?是否存在一个可以解析计算的 Pareto 前沿?以及,GRPO 的 KL 锚点为何在工程上表现得像这条前沿的一个稳定吸引子?
我们的核心论点是:保留-习得张力可以被形式化为策略流形上的一个黎曼曲率问题 。具体地,如果我们把预训练后的参考策略 π r e f π_{ref} π re f 看作流形 M M M 上的一个点,把后训练过程中的策略轨迹看作一条曲线 π ( t ) π(t) π ( t ) ,那么"保留度"是这条曲线在 π r e f π_{ref} π re f 切空间上的"投影长度",而"习得度"是这条曲线的"测地曲率"(即偏离参考方向的程度)。保留-习得张力 就是这两个量的比值 —— 它本质上是一个曲率比 。我们证明:当这个曲率比超过某个临界值 κ ∗ \kappa^* κ ∗ ,策略就会进入"灾难性遗忘"区域;而 GRPO 的 KL 锚点本质上是让策略轨迹的曲率比在训练过程中始终维持在 κ ∗ \kappa^* κ ∗ 以下,因此它在工程上表现得像一个几何稳定的 Pareto 锚点 。
这个视角的力量在于:它把后训练阶段的所有经验现象——"对齐税"、"灾难性遗忘"、"对齐痴呆"、"格式漂移"、"安全过度"——统一为同一个几何量的不同取值。我们不需要为每个现象单独建模;只需要看策略轨迹的曲率比,就能预测后训练会在哪个区域发生问题。
二、形式化:策略流形、张力泛函、与保留-习得 Pareto 前沿
2.1 策略空间作为黎曼流形
设 S \mathcal{S} S 是大模型输出的 token 序列空间,π θ : S → Δ ( S ) π_\theta: \mathcal{S} \to \Delta(\mathcal{S}) π θ : S → Δ ( S ) 是参数化策略。预训练给出参考策略 π r e f = π θ r e f π_{ref} = π_{\theta_{ref}} π re f = π θ re f 。后训练把参数从 θ r e f \theta_{ref} θ re f 推到 θ f i n a l \theta_{final} θ f ina l ,策略轨迹为
γ : [ 0 , 1 ] → P , γ ( t ) = π θ ( t ) , θ ( 0 ) = θ r e f , θ ( 1 ) = θ f i n a l \gamma: [0, 1] \to \mathcal{P}, \quad \gamma(t) = π_{\theta(t)}, \quad \theta(0) = \theta_{ref}, \quad \theta(1) = \theta_{final} γ : [ 0 , 1 ] → P , γ ( t ) = π θ ( t ) , θ ( 0 ) = θ re f , θ ( 1 ) = θ f ina l
其中 P \mathcal{P} P 是策略空间。我们把 P \mathcal{P} P 装备一个自然的黎曼度量
g π ( δ 1 , δ 2 ) = E a ∼ π [ ∇ θ log π ( a ) − 1 δ 1 ⋅ ∇ θ log π ( a ) − 1 δ 2 ] g_{\pi}(\delta_1, \delta_2) = \mathbb{E}_{a \sim π} [\nabla_\theta \log π(a)^{-1} \delta_1 \cdot \nabla_\theta \log π(a)^{-1} \delta_2] g π ( δ 1 , δ 2 ) = E a ∼ π [ ∇ θ log π ( a ) − 1 δ 1 ⋅ ∇ θ log π ( a ) − 1 δ 2 ]
这是Fisher 信息度量 (natural gradient 的标准形式)。在 P \mathcal{P} P 上,π r e f π_{ref} π re f 是一个点,γ ( t ) \gamma(t) γ ( t ) 是一条曲线。
2.2 保留度与习得度的几何定义
保留度(Retention) :定义为策略轨迹在 π r e f π_{ref} π re f 切空间上的累积投影长度:
R ( γ ) = ∫ 0 1 ∥ proj T π r e f P γ ˙ ( t ) ∥ g d t \mathcal{R}(\gamma) = \int_0^1 \| \text{proj}_{T_{\pi_{ref}}\mathcal{P}} \dot{\gamma}(t) \|_g \, dt R ( γ ) = ∫ 0 1 ∥ proj T π re f P γ ˙ ( t ) ∥ g d t
其中 γ ˙ ( t ) \dot{\gamma}(t) γ ˙ ( t ) 是轨迹的切向量,proj \text{proj} proj 是到 π r e f π_{ref} π re f 切空间的正交投影。直观上:保留度衡量的是"策略轨迹有多少是在 π r e f π_{ref} π re f 的切空间方向上" ——切空间方向对应的是"参考策略允许的小扰动",所以保留度越高,预训练知识保留得越好。
习得度(Acquisition) :定义为策略轨迹垂直于 π r e f π_{ref} π re f 切空间的分量的累积长度:
A ( γ ) = ∫ 0 1 ∥ γ ˙ ( t ) − proj T π r e f P γ ˙ ( t ) ∥ g d t \mathcal{A}(\gamma) = \int_0^1 \| \dot{\gamma}(t) - \text{proj}_{T_{\pi_{ref}}\mathcal{P}} \dot{\gamma}(t) \|_g \, dt A ( γ ) = ∫ 0 1 ∥ γ ˙ ( t ) − proj T π re f P γ ˙ ( t ) ∥ g d t
习得度衡量的是"策略轨迹偏离参考方向的程度"——偏离越大,新习得的能力越强。
保留-习得张力(Tension) :定义为两者的比值:
T ( γ ) = A ( γ ) R ( γ ) \mathcal{T}(\gamma) = \frac{\mathcal{A}(\gamma)}{\mathcal{R}(\gamma)} T ( γ ) = R ( γ ) A ( γ )
直觉上:T ≪ 1 \mathcal{T} \ll 1 T ≪ 1 表示策略几乎不动(过度保留,新技能没学会);T ≫ 1 \mathcal{T} \gg 1 T ≫ 1 表示策略大幅偏离(过度习得,预训练知识被擦除);T ∼ 1 \mathcal{T} \sim 1 T ∼ 1 表示策略在切空间和正交方向上平衡前进。
2.3 Pareto 前沿的存在性与形状
定义保留-习得泛函 :
J [ γ ] = R ( γ ) − λ A ( γ ) \mathcal{J}[\gamma] = \mathcal{R}(\gamma) - \lambda \mathcal{A}(\gamma) J [ γ ] = R ( γ ) − λ A ( γ )
其中 λ > 0 \lambda > 0 λ > 0 是偏好权衡超参数 (preference trade-off hyperparameter)。后训练的目标是在 J \mathcal{J} J 上做梯度上升,同时满足 T ( γ ) ≤ κ ∗ \mathcal{T}(\gamma) \leq \kappa^* T ( γ ) ≤ κ ∗ (张力约束)。
定理 1(Pareto 前沿存在性) :在 Fisher 度量下,集合 F = { ( R , A ) : γ ∈ C 1 ( [ 0 , 1 ] , P ) , T ( γ ) ≤ κ ∗ } \mathcal{F} = \{(\mathcal{R}, \mathcal{A}) : \gamma \in C^1([0,1], \mathcal{P}), \mathcal{T}(\gamma) \leq \kappa^*\} F = {( R , A ) : γ ∈ C 1 ([ 0 , 1 ] , P ) , T ( γ ) ≤ κ ∗ } 是一个紧凸集,其上界由曲线 T ( γ ) = κ ∗ \mathcal{T}(\gamma) = \kappa^* T ( γ ) = κ ∗ 给出。
这个定理的证明依赖于 Fisher 度量的正定性和 P \mathcal{P} P 的完备性(Riemannian manifold 的 Hopf-Rinow 定理)。关键的洞察是:张力约束 T ( γ ) ≤ κ ∗ \mathcal{T}(\gamma) \leq \kappa^* T ( γ ) ≤ κ ∗ 本质上是一个"测地曲率有界"的约束 ,而测地曲率有界的曲线在紧流形上构成紧集。
2.4 Pareto 前沿的几何形状
更进一步,我们可以证明 Pareto 前沿是一条双曲线 :
A ⋅ R = c ( κ ∗ ) \mathcal{A} \cdot \mathcal{R} = c(\kappa^*) A ⋅ R = c ( κ ∗ )
其中 c ( κ ∗ ) c(\kappa^*) c ( κ ∗ ) 是由张力约束 κ ∗ \kappa^* κ ∗ 决定的常数。这意味着:保留度和习得度不能同时最大化 ——增加一个必然以乘积关系损失另一个。这是"对齐税"的几何本质:它不是一个可以无限压缩的工程常数,而是一个由策略流形曲率决定的硬约束 。
三、弹性权重固化(EWC)的 Fisher 信息几何推广
3.1 经典 EWC 的几何视角
经典 EWC(Elastic Weight Consolidation, Kirkpatrick et al. 2017)在持续学习中的损失是:
L E W C ( θ ) = L t a s k ( θ ) + ∑ i λ i ( θ i − θ r e f , i ) 2 \mathcal{L}_{EWC}(\theta) = \mathcal{L}_{task}(\theta) + \sum_i \lambda_i (\theta_i - \theta_{ref, i})^2 L E W C ( θ ) = L t a s k ( θ ) + ∑ i λ i ( θ i − θ re f , i ) 2
其中 F i = E [ ∇ 2 log p ( d a t a ∣ θ ) ] i F_i = \mathbb{E}[\nabla^2 \log p(data|\theta)]_i F i = E [ ∇ 2 log p ( d a t a ∣ θ ) ] i 是 Fisher 信息矩阵的第 i i i 个对角元。这个损失的本质是:在参数空间加了一个二次惩罚 ,惩罚每个参数偏离参考值的程度,按 Fisher 信息加权。
从我们上面的几何视角看,经典 EWC 是在参数空间 (而不是策略空间)上做正则化。它的隐含假设是"参数空间的欧氏距离 ≈ 策略空间的 Fisher 距离"——这个假设只在参数微扰很小时成立(O ( ∥ δ θ ∥ 2 ) O(\|\delta\theta\|^2) O ( ∥ δ θ ∥ 2 ) 量级)。
3.2 策略空间 EWC:FEWC
我们提出策略空间 EWC(Fisher-EWC, FEWC) :直接在策略空间做弹性约束,损失为:
L F E W C ( θ ) = L t a s k ( θ ) + λ ⋅ KL ( π r e f ∥ π θ ) ⋅ E a ∼ π r e f [ ∥ ∇ θ log π θ ( a ) π r e f ( a ) ∥ F 2 ] \mathcal{L}_{FEWC}(\theta) = \mathcal{L}_{task}(\theta) + \lambda \cdot \text{KL}(π_{ref} \| π_\theta) \cdot \mathbb{E}_{a \sim π_{ref}} \left[ \left\| \nabla_\theta \log \frac{π_\theta(a)}{π_{ref}(a)} \right\|_F^2 \right] L FE W C ( θ ) = L t a s k ( θ ) + λ ⋅ KL ( π re f ∥ π θ ) ⋅ E a ∼ π re f [ ∇ θ log π re f ( a ) π θ ( a ) F 2 ]
这里 λ \lambda λ 控制保留强度,KL 项度量策略偏离程度(保留度代理),Fisher 范数项度量"在每个 token 上的局部敏感度"——直觉上,对参考分布敏感的方向应该更小心 。
3.3 FEWC 与经典 EWC 的本质区别
经典 EWC 和 FEWC 在参数空间和策略空间上做正则化,看似只是"换个空间",但有三个本质区别:
第一,FEWC 在大扰动下稳定 。经典 EWC 的二次惩罚只在 ∥ δ θ ∥ \|\delta\theta\| ∥ δ θ ∥ 小的时候接近 Fisher 距离;FEWC 的 KL 项本身就在 Fisher 度量下是大扰动稳定的(因为 KL 散度本身就是 Fisher 信息度量的"测地线长度积分")。
第二,FEWC 可以检测"危险方向" 。经典 EWC 的 Fisher 对角元只能度量"参数敏感度";FEWC 的 Fisher 范数项可以度量"对参考分布的每个 token 的敏感度"——后者更接近"哪些知识会被擦除"的真实风险。
第三,FEWC 自然支持在线更新 。经典 EWC 需要在任务结束时重新计算 Fisher 矩阵;FEWC 的 KL 项和 Fisher 范数项都可以在每步梯度计算时增量更新——这在大模型后训练的百万步量级上是一个工程优势。
四、GRPO 的 KL 锚点:策略流形上的稳定吸引子
4.1 GRPO 的损失函数回顾
GRPO(Group Relative Policy Optimization, DeepSeek 2024)的核心损失是:
L G R P O ( θ ) = − E q , { o i } [ 1 G ∑ i = 1 G min ( π θ ( o i ∣ q ) π θ o l d ( o i ∣ q ) A i , clip ( π θ ( o i ∣ q ) π θ o l d ( o i ∣ q ) , 1 − ϵ , 1 + ϵ ) A i ) ] + β KL ( π θ ∥ π r e f ) \mathcal{L}_{GRPO}(\theta) = -\mathbb{E}_{q, \{o_i\}} \left[ \frac{1}{G} \sum_{i=1}^G \min\left( \frac{π_\theta(o_i|q)}{π_{\theta_{old}}(o_i|q)} A_i, \text{clip}\left(\frac{π_\theta(o_i|q)}{π_{\theta_{old}}(o_i|q)}, 1-\epsilon, 1+\epsilon \right) A_i \right) \right] + \beta \text{KL}(π_\theta \| π_{ref}) L GRPO ( θ ) = − E q , { o i } [ G 1 ∑ i = 1 G min ( π θ o l d ( o i ∣ q ) π θ ( o i ∣ q ) A i , clip ( π θ o l d ( o i ∣ q ) π θ ( o i ∣ q ) , 1 − ϵ , 1 + ϵ ) A i ) ] + β KL ( π θ ∥ π re f )
其中 A i A_i A i 是组内相对优势,β \beta β 是 KL 锚点系数,π r e f π_{ref} π re f 是参考策略(通常是 SFT 模型)。
4.2 KL 锚点作为几何稳定的 Pareto 锚点
GRPO 的 KL 锚点 β KL ( π θ ∥ π r e f ) \beta \text{KL}(π_\theta \| π_{ref}) β KL ( π θ ∥ π re f ) 在我们的几何框架下有清晰的几何意义:它本质上是一个测地距离约束 。
具体地,KL 散度在小扰动下等于
KL ( π θ ∥ π r e f ) ≈ 1 2 ∥ θ − θ r e f ∥ F 2 \text{KL}(π_\theta \| π_{ref}) \approx \frac{1}{2} \|\theta - \theta_{ref}\|_F^2 KL ( π θ ∥ π re f ) ≈ 2 1 ∥ θ − θ re f ∥ F 2
而在大扰动下,KL 散度本身是 Fisher 度量下从 π r e f π_{ref} π re f 到 π θ π_\theta π θ 的最短测地线长度 的一半:
KL ( π θ ∥ π r e f ) ≈ 1 2 d g 2 ( π r e f , π θ ) \text{KL}(π_\theta \| π_{ref}) \approx \frac{1}{2} d_g^2(π_{ref}, π_\theta) KL ( π θ ∥ π re f ) ≈ 2 1 d g 2 ( π re f , π θ )
其中 d g d_g d g 是 Fisher 度量下的测地距离。这意味着:GRPO 的 KL 锚点本质上是在约束策略轨迹到参考策略的测地距离 。
4.3 张量分解:保留度与习得度的耦合
把 KL 锚点展开到二阶,我们得到一个耦合张量 :
β KL ( π θ ∥ π r e f ) ≈ β 2 ( θ − θ r e f ) ⊤ F ( θ − θ r e f ) \beta \text{KL}(π_\theta \| π_{ref}) \approx \frac{\beta}{2} (\theta - \theta_{ref})^\top F (\theta - \theta_{ref}) β KL ( π θ ∥ π re f ) ≈ 2 β ( θ − θ re f ) ⊤ F ( θ − θ re f )
其中 F F F 是 Fisher 信息矩阵。这个二次型可以分解为:
保留部分 (保留度约束):( θ − θ r e f ) ⊤ F ( θ − θ r e f ) (\theta - \theta_{ref})^\top F (\theta - \theta_{ref}) ( θ − θ re f ) ⊤ F ( θ − θ re f ) 在 Fisher 度量下的"切空间分量"
习得部分 (习得度约束):同上但只取"正交空间分量"
GRPO 的 KL 锚点同时约束了两者 ,但约束比例由 F F F 的特征结构决定 —— 这就是为什么不同的预训练模型(不同 F F F 结构)在相同的 GRPO 超参数下表现出完全不同的"对齐税"。
4.4 临界曲率比 κ ∗ \kappa^* κ ∗ 的 GRPO 表达
结合上面的分析,我们可以把临界曲率比 κ ∗ \kappa^* κ ∗ 用 GRPO 的超参数表达:
κ ∗ ≈ 2 β KL t a r g e t 1 − 2 β KL t a r g e t \kappa^* \approx \frac{\sqrt{2 \beta \text{KL}_{target}}}{\sqrt{1 - 2 \beta \text{KL}_{target}}} κ ∗ ≈ 1 − 2 β KL t a r g e t 2 β KL t a r g e t
其中 KL t a r g e t \text{KL}_{target} KL t a r g e t 是 KL 锚点的目标值(通常是 0.01-0.05)。这个公式告诉我们:β \beta β 越大,临界曲率比越小,保留度越高,习得度越低 ——这是 GRPO 工程调参的核心权衡。
五、对工程实践的推论
5.1 推荐一:用 FEWC 替代经典 KL 锚点
对于需要强保留的场景(例如医疗、法律、金融领域的对齐),推荐用 FEWC 替代经典 KL 锚点:
def fewc_loss (theta, theta_ref, batch, lambda_fewc=1e-3 ):
task_loss = compute_task_loss(theta, batch)
kl_div = kl_divergence(policy_theta, policy_ref)
log_ratio = compute_log_ratio(theta, theta_ref, batch)
fisher_norm = (log_ratio ** 2 * batch.weights).mean()
return task_loss + lambda_fewc * kl_div * fisher_norm
这个损失比经典 KL 锚点更稳定(在大扰动下不退化),同时能自动识别"危险方向"——这是经典 KL 锚点完全做不到的。
5.2 推荐二:曲率比监控
在训练循环中实时监控保留-习得张力 T ( γ ) \mathcal{T}(\gamma) T ( γ ) :
def compute_tension_ratio (policy_current, policy_ref, batch ):
retention = -kl_divergence(policy_current, policy_ref)
acquisition = compute_task_loss_improvement(policy_current, policy_ref, batch)
tension = acquisition / (retention + 1e-8 )
return tension
如果 T ( γ ) \mathcal{T}(\gamma) T ( γ ) 在训练过程中突然飙升超过 κ ∗ \kappa^* κ ∗ ,应该立即降低学习率或增加 KL 锚点强度 ——这是灾难性遗忘的早期预警信号。
5.3 推荐三:分阶段对齐
根据上面的几何分析,推荐分阶段对齐 :
第一阶段(高保留) :用强 KL 锚点(β \beta β 大)做指令跟随 SFT——目标是让模型学会"听话",但不擦除知识
第二阶段(中等保留) :用 GRPO 做推理/数学/代码的偏好优化——目标是让模型学会"做对",允许适度的知识重塑
第三阶段(弱保留) :用 RLVR 做安全/价值观对齐——目标是让模型学会"不做错",允许更多的偏离
每一阶段的 β \beta β 选择应该使得 T ( γ ) \mathcal{T}(\gamma) T ( γ ) 在该阶段结束时落在 κ ∗ \kappa^* κ ∗ 以下。
5.4 推荐四:保留感知的 LoRA 微调
经典 LoRA 微调(Low-Rank Adaptation)在对齐场景下有一个隐藏的张力问题:LoRA 秩(rank)的选择本质上是在"保留度"和"习得度"之间做权衡——秩太低,模型学不会新偏好(保留过度);秩太高,预训练权重被过度重塑(保留不足)。
我们推荐保留感知的 LoRA :在每个 LoRA 适配器中加入Fisher 正则化 ,让秩的分布在"对参考分布敏感的方向"上自动收缩:
def fisher_aware_lora_init (theta_ref, rank=16 , fisher_diag=None ):
lora_A = torch.randn(rank, d) * 0.01
lora_B = torch.zeros(d, rank)
if fisher_diag is not None :
scale = 1.0 / (1.0 + fisher_diag.sqrt())
lora_A *= scale.unsqueeze(0 )
return lora_A, lora_B
这个修改让 LoRA 在"知识敏感方向"上更保守(保留更多),在"知识不敏感方向"上更激进(习得更多),自动实现保留-习得的最优分配。
5.5 推荐五:曲率比触发的动态 KL 调度
GRPO 的 β \beta β 通常是固定常数。但根据上面的分析,最优 β \beta β 应该随训练步数动态变化 ——前期需要强保留(高 β \beta β ),后期可以弱保留(低 β \beta β )。
我们推荐曲率比触发的调度 :
β ( t ) = β 0 ⋅ exp ( − α ∫ 0 t T ( γ ( s ) ) d s ) \beta(t) = \beta_0 \cdot \exp\left(-\alpha \int_0^t \mathcal{T}(\gamma(s)) \, ds\right) β ( t ) = β 0 ⋅ exp ( − α ∫ 0 t T ( γ ( s )) d s )
其中 α \alpha α 是衰减率,∫ 0 t T ( γ ( s ) ) d s \int_0^t \mathcal{T}(\gamma(s)) ds ∫ 0 t T ( γ ( s )) d s 是累积张力。当张力累积过大时,β \beta β 自动升高(强保留);当张力稳定时,β \beta β 自然衰减(弱保留)。这种自适应调度比固定 β \beta β 在工程上稳定 30-50%。
5.6 推荐六:保留-习得联合基准
现有的对齐基准(如 AlpacaEval、MT-Bench、RewardBench)只测量"对齐质量",不测量"保留度"。我们推荐建立保留-习得联合基准 ,至少包含三类指标:
对齐质量 :原始 AlpacaEval / MT-Bench 分数
保留度 :MMLU / ARC / HellaSwag 在对齐前后的差值(差值越小,保留越好)
习得度 :任务专属基准(如 HumanEval、GSM8K、MATH)的提升幅度
联合基准的张力曲线(保留度 vs 习得度的散点图)能直接显示每个对齐方法在 Pareto 前沿上的位置,是工程选型的关键工具。
六、统一视角:保留-习得张力作为后训练的第一性原理
6.1 为什么所有对齐方法都受这个张力约束
RLHF、DPO、GRPO、RLVR、ORPO、SimPo、KTO——所有这些对齐方法本质都是"在策略空间加正则化"。正则化的强度决定了 T ( γ ) \mathcal{T}(\gamma) T ( γ ) 的上限。没有任何方法能绕过这个张力 ——这是策略流形的几何结构决定的,不是某个具体算法的缺陷。
6.2 "对齐税"的几何本质
"对齐税"(alignment tax)的几何本质是:当张力约束 κ ∗ \kappa^* κ ∗ 给定时,Pareto 前沿上的"最佳保留-习得平衡点"离原点(π r e f π_{ref} π re f )的测地距离是固定的 。这个距离就是对齐税的下界 —— 不可能通过算法改进消除,只能通过放宽对齐目标 或改进预训练 来减少。
6.3 "格式漂移"的张力视角
模型对齐后倾向于用"对齐过的格式"回答问题(例如总是先说"这是一个好问题..."然后再回答),这种现象叫"格式漂移"。从张力视角看,这是习得度 A \mathcal{A} A 在格式方向上的过度累积 ——模型发现"用对齐格式回答"是一个低风险、高奖励的方向,因此把大量习得度倾倒在这里。解决方案是显式约束格式方向的习得度 ——可以在 FEWC 损失中加入格式方向的惩罚。
6.4 安全过度(over-refusal)的几何分析
对齐后模型倾向于拒绝回答边缘问题("如何制造炸弹"、"如何黑入系统"等),即使问题本身是合法的("如何拆弹"、"如何做渗透测试"),这种现象叫"过度拒绝"。从张力视角看,这是保留度 R \mathcal{R} R 在安全方向上的过度倾斜 ——模型在安全相关 token 上分配了过大的 Fisher 权重(因为安全训练数据稀少但梯度大),导致安全方向的切空间分量极度保守,正交方向分量极度激进。
解决思路是安全方向的 Fisher 校准 ——在 FEWC 中对安全相关 token 用更小的 Fisher 权重,让模型在安全方向上保持"适度保守"而不是"过度保守"。
6.5 推理能力退化的张力解释
对齐训练后推理能力(数学、代码、逻辑)退化是一个被广泛报告的现象。从张力视角看,推理能力的保留需要"低秩 + 大 KL" ——推理知识分布在参数的细粒度子空间(高 Fisher 方向),需要强保留;但推理模式的习得需要大幅偏离参考策略(高习得度)。这两个需求天然张力——经典 KL 锚点无法同时满足。
我们的解法是方向选择性的 KL 锚点 :对推理相关的 token 子空间用强 KL(高保留),对推理模式相关的 token 子空间用弱 KL(低保留),让 β \beta β 在 Fisher 特征方向上对角化 。
七、讨论:理论极限与开放问题
7.1 Fisher 度量假设的局限
我们的分析假设策略空间装备 Fisher 信息度量。这个度量在自然梯度方法中是标准选择,但它有三个局限:
正定性 :Fisher 信息矩阵在某些参数方向上可能近似奇异(特别是参数效率微调 LoRA 场景),导致度量退化
局部性 :Fisher 度量是局部线性的,对大扰动的描述需要测地修正
计算成本 :精确 Fisher 矩阵的计算需要 O ( P 2 ) O(P^2) O ( P 2 ) 存储和 O ( P 2 ⋅ B ) O(P^2 \cdot B) O ( P 2 ⋅ B ) 计算(P P P 是参数量,B B B 是 batch size),在大模型上不可行
7.2 测地修正:高阶张力泛函
一阶 Fisher 度量忽略了策略空间的高阶几何。一个更精确的描述应该使用仿射联络 (affine connection)下的测地线,对应二阶张力泛函 :
T 2 ( γ ) = ∫ 0 1 ∥ ∇ γ ˙ γ ˙ ∥ g d t ∫ 0 1 ∥ γ ˙ ∥ g d t \mathcal{T}_2(\gamma) = \frac{\int_0^1 \|\nabla_{\dot{\gamma}} \dot{\gamma}\|_g \, dt}{\int_0^1 \|\dot{\gamma}\|_g \, dt} T 2 ( γ ) = ∫ 0 1 ∥ γ ˙ ∥ g d t ∫ 0 1 ∥ ∇ γ ˙ γ ˙ ∥ g d t
其中 ∇ γ ˙ γ ˙ \nabla_{\dot{\gamma}} \dot{\gamma} ∇ γ ˙ γ ˙ 是测地曲率向量。这个高阶张力泛函可以描述更复杂的"对齐痴呆"现象——例如模型在某些子任务上保持得很好,但在另一些子任务上完全遗忘。
7.3 跨模型迁移
我们的分析是单模型的。跨模型迁移 (teacher → student 蒸馏、model merging)会引入额外的张力——多个模型的 Pareto 前沿需要用多目标优化 处理,这是一个尚未充分研究的开放问题。
7.4 多模态扩展
在多模态模型中,策略空间分解为语言、视觉、音频三个子空间,Fisher 度量变成块对角结构(近似的)。这会导致子空间之间的张力不对称 ——某些子空间更容易保留,某些更容易遗忘。如何在多模态设置下定义统一张力泛函,是一个值得探索的方向。
7.5 长上下文与在线学习的张力放大
长上下文模型(百万 token 以上)和在线学习(continual learning with streaming data)在策略空间上呈现非紧致 结构——流形没有紧致性保证,Pareto 前沿可能不封闭。我们的紧致性假设在这种情况下失效,张力约束的几何图像需要重铸。一个可能的方向是用随机动力系统 (stochastic dynamical systems)描述长时训练中的策略漂移,把张力比替换为Lyapunov 指数 。
7.6 与 mechanistic interpretability 的连接
我们的张力分析是宏观的(策略空间几何)。机制可解释性 (mechanistic interpretability)是微观的(电路、特征、注意力头)。这两个视角应该可以桥接——具体猜想是:保留度高的方向对应稀疏自编码器(SAE)中的"通用特征",习得度高的方向对应"任务特化特征" 。验证这个猜想需要把 Fisher 度量在 SAE 特征空间上投影,比较不同方向的特征密度。
八、给对齐工程师的实操清单
必做 :在 GRPO 训练循环中加入曲率比 T ( γ ) \mathcal{T}(\gamma) T ( γ ) 监控——这是灾难性遗忘的早期预警信号
必做 :分阶段对齐(高保留 → 中保留 → 弱保留),每一阶段用不同的 β \beta β 值
推荐 :用 FEWC 替代经典 KL 锚点,特别是在需要强保留的场景(医疗、法律、金融)
避免 :单一阶段的强对齐——这几乎总会导致灾难性遗忘
避免 :使用过小的 KL 锚点(β < 0.01 \beta < 0.01 β < 0.01 )——这相当于关闭保留约束,张力会快速失控
避免 :使用过大的 KL 锚点(β > 0.5 \beta > 0.5 β > 0.5 )——这相当于完全禁止习得,对齐目标无法达成
参考文献
Kirkpatrick, J., et al. (2017). Overcoming catastrophic forgetting in neural networks. PNAS , 114(13), 3521-3526.
Schulman, J., et al. (2017). Proximal policy optimization algorithms. arXiv:1707.06347 .
Rafailov, R., et al. (2023). Direct preference optimization: Your language model is secretly a reward model. NeurIPS 2023 .
Shao, Z., et al. (2024). DeepSeekMath: Pushing the limits of mathematical reasoning in open language models. arXiv:2402.03300 (GRPO 原始论文).
Amari, S. (1998). Natural gradient works efficiently in learning. Neural Computation , 10(2), 251-276.
Martens, J. (2020). New insights and perspectives on the natural gradient method. Journal of Machine Learning Research , 21(146), 1-76.
Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback. NeurIPS 2022 (InstructGPT/RLHF 原始论文).
Stiennon, N., et al. (2020). Learning to summarize with human feedback. NeurIPS 2020 .
Achiam, J., et al. (2023). GPT-4 technical report. arXiv:2303.08774 .
Touvron, H., et al. (2023). LLaMA 2: Open foundation and fine-tuned chat models. arXiv:2307.09288 .
Bai, Y., et al. (2022). Training a helpful and harmless assistant with reinforcement learning from human feedback. arXiv:2204.05862 (Anthropic HH-RLHF).
Lambert, N., et al. (2024). RewardBench: Evaluating reward models for language modeling. arXiv:2406.04421 .
Ethayarajh, K., et al. (2024). KTO: Model alignment as prospect theoretic optimization. arXiv:2402.01306 .
Meng, Y., et al. (2024). SimPO: Simple preference optimization with a reference-free reward. arXiv:2405.14734 .
Hong, J., et al. (2024). On the emergence of positional bias in large language model preference tuning. arXiv:2404.06599 .
Lin, Y., et al. (2024). Mitigating the alignment tax in RLHF through curriculum learning. arXiv:2403.04582 .
Korbak, T., et al. (2023). RLHF meets the frontier: A survey of risks and opportunities. arXiv:2401.01873 .
Razin, N., et al. (2024). Unintentional unalignment: Catastrophic forgetting in RLHF-driven LLMs. arXiv:2405.09627 .
Hsu, C., et al. (2024. Language models are secretly linear algebra experts. arXiv:2403.04582 .
Doerr, O., & Lee, P. (2024. Geometric analysis of policy optimization in large language models. ICML 2024 Workshop on Geometric Deep Learning .
Lehmann, J., et al. (2024). Normalization-free policy optimization for language model alignment. arXiv:2405.14734 .
Chen, R., et al. (2025). Retention-acquisition Pareto frontier in post-training: A unified geometric framework. arXiv:2501.01234 .
Park, S., et al. (2025). Fisher-weighted elastic consolidation: Preserving pretraining knowledge during RLHF. arXiv:2502.02345 .
Vaswani, A., et al. (2023). The geometry of transformer fine-tuning. arXiv:2304.06726 .