Blog·Studio
文章系列日历归档关于搜索
Blog·Studio

一个记录思考、笔记与作品的技术博客。

Connect

© 2026 · Blog Studio

鄂ICP备19019526号

crafted with care

stay curious ✦

  1. 文章
  2. ›稀疏自编码器与电路发现的统计学习统一理论 2026

Index

  • 一、问题的提出:机械可解释性的两阶段裂隙
  • 二、形式化:SAE 字典学习 + 电路发现的二元目标
  • 三、主体 1:SAE 稀疏特征的统计学习理论
  • 四、主体 2:电路发现的信息论与因果视角
  • 五、主体 3:SAE-电路桥接:从特征到回路的映射
  • 六、统一视角:几何 + 信息论 + 因果三件套
  • 七、对工程实践的推论
  • 八、讨论:与 Anthropic / DeepMind 实证的对比
  • 九、给研究者:开放问题与下一步实验
  • 参考文献

稀疏自编码器与电路发现的统计学习统一理论 2026

把稀疏自编码器与电路发现统一为残差流激活的稀疏因果分解,几何-信息论-因果三件套训练目标使 SAE 特征成为可干预、可审计、可蒸馏的电路原子,在 7B-13B 模型上已具备工程化训练与红队探针的落地条件。

2026年9月5日·约 30 分钟阅读·8,845 字·8 次阅读·博主
#大模型研究
稀疏自编码器与电路发现的统计学习统一理论 2026

Index

  • 一、问题的提出:机械可解释性的两阶段裂隙
  • 二、形式化:SAE 字典学习 + 电路发现的二元目标
  • 三、主体 1:SAE 稀疏特征的统计学习理论
  • 四、主体 2:电路发现的信息论与因果视角
  • 五、主体 3:SAE-电路桥接:从特征到回路的映射
  • 六、统一视角:几何 + 信息论 + 因果三件套
  • 七、对工程实践的推论
  • 八、讨论:与 Anthropic / DeepMind 实证的对比
  • 九、给研究者:开放问题与下一步实验
  • 参考文献

稀疏自编码器与电路发现的统计学习统一理论 2026:从特征字典学习到因果电路的统计学习视角

一、问题的提出:机械可解释性的两阶段裂隙

在 2024-2026 这两年里,机械可解释性(mechanistic interpretability)领域形成了一条共识裂隙:一方面,稀疏自编码器(Sparse Autoencoder,SAE)能在中等规模模型(LLaMA-3 8B、GPT-2 small)上学习出百万级的可解释特征,实证显示每个 SAE 神经元都对应一个语义上可命名的概念(从莎士比亚人物到 Python 函数调用);另一方面,电路发现(circuit discovery)技术(路径补丁、因果追踪、属性替换)能定位具体回路(如 induction head、indirect object identification circuit),但这些回路通常由 5-50 个 attention head 组成,与 SAE 特征之间没有一一对应的映射。这种裂隙让整个领域的工程化进展停留在"看图说话"阶段:我们知道哪些特征被激活,我们知道哪些 head 在哪些回路中,但特征与 head 之间的因果链条是缺失的。本文试图在统计学习理论框架下,把这两个阶段统一为同一个目标:从残差流激活中学习结构化稀疏表示,并证明这个表示的某些基函数恰好对应到可干预的因果回路。

二、形式化:SAE 字典学习 + 电路发现的二元目标

设语言模型的残差流激活为 x∈Rd\mathbf{x} \in \mathbb{R}^dx∈Rd(典型 d=4096d = 4096d=4096 或 819281928192)。SAE 学习一个过完备字典 D∈Rd×m\mathbf{D} \in \mathbb{R}^{d \times m}D∈Rd×m,其中 m≫dm \gg dm≫d(典型 m=131072m = 131072m=131072 或 m=16dm = 16dm=16d),并把激活编码为稀疏码 z=Enc(x)∈Rm\mathbf{z} = \text{Enc}(\mathbf{x}) \in \mathbb{R}^mz=Enc(x)∈Rm,再通过 x^=Dz\hat{\mathbf{x}} = \mathbf{D}\mathbf{z}x^=Dz 重建。经典 SAE 损失是重建误差加 L1 稀疏: LSAE=∥x−Dz∥22+λ∥z∥1\mathcal{L}_{\text{SAE}} = \|\mathbf{x} - \mathbf{D}\mathbf{z}\|_2^2 + \lambda \|\mathbf{z}\|_1LSAE​=∥x−Dz∥22​+λ∥z∥1​

电路发现的目标不同:给定任务 T\mathcal{T}T(如"预测下一个 token 是否为人名")和参考语料 D={xi}\mathcal{D} = \{x_i\}D={xi​},寻找最小子集 C⊆Heads∪Neurons\mathcal{C} \subseteq \text{Heads} \cup \text{Neurons}C⊆Heads∪Neurons 使得 Ex∼D[MetricT(model∣Cablate,model)]≥τ\mathbb{E}_{x \sim \mathcal{D}}\left[\text{Metric}_{\mathcal{T}}(\text{model}|_{\mathcal{C}\text{ablate}}, \text{model})\right] \geq \tauEx∼D​[MetricT​(model∣Cablate​,model)]≥τ 其中 τ\tauτ 是阈值(典型 0.90.90.9),ablate\text{ablate}ablate 表示把子集替换为均值激活。这两个目标的数学形式完全不同:SAE 是生成式字典学习,电路发现是判别式子集选择。一个自然的统一假设是:SAE 特征是电路中 attention head 输出的稀疏表示,而电路是 SAE 特征的因果支撑集。

三、主体 1:SAE 稀疏特征的统计学习理论

SAE 的过完备性带来一个根本张力:在 m≫dm \gg dm≫d 的设定下,只要允许编码 z\mathbf{z}z 取任意实数,重建误差总能达到 0;但 L1 惩罚下的稀疏解的统计性质取决于字典 D\mathbf{D}D 的几何结构。具体地,定义 Gram 矩阵 G=D⊤D\mathbf{G} = \mathbf{D}^\top \mathbf{D}G=D⊤D,若 G\mathbf{G}G 的互相关系数 μ(G)=max⁡i≠j∣Gij∣/GiiGjj\mu(\mathbf{G}) = \max_{i \neq j} |\mathbf{G}_{ij}| / \sqrt{\mathbf{G}_{ii}\mathbf{G}_{jj}}μ(G)=maxi=j​∣Gij​∣/Gii​Gjj​​ 足够小,则 L1 解在样本复杂度 n=O((log⁡m)/γ2)n = \mathcal{O}((\log m) / \gamma^2)n=O((logm)/γ2) 下能恢复真实稀疏码 z\*\mathbf{z}^\*z\*,其中 γ\gammaγ 是最小非零分量。这与 compressed sensing 的经典结果(Donoho-Tanner 相变)直接对应。

然而,SAE 训练实践从来不满足这个条件:互相关系数 μ\muμ 典型在 0.3-0.7 之间,远高于 compressed sensing 的"小 μ\muμ"假设。这意味着 SAE 学到的字典是高冗余的,稀疏码 z\mathbf{z}z 包含大量"借用"分量——这正是 TopK SAE(激活前 K 个,其余置零)、JumpReLU(自适应阈值)以及 2026 年新出现的 BatchTopK(整 batch 内竞争 K 个)试图解决的问题。从统计学习理论视角,这些改进实质上是在约束编码算子的有效维度:把 L1 惩罚的"软稀疏"替换为"硬稀疏",从而把 μ\muμ 条件放宽到 μ<1\mu < 1μ<1 的任意值,但代价是引入量化误差。TopK SAE 的 K 选择因此变成 bias-variance 权衡:K 太小导致重建过差,K 太大则稀疏性退化为稠密重建。

第二个统计学习的关键观察是字典原子与模型神经元的关系:SAE 训练完成后,经验证每个 SAE 特征 zjz_jzj​ 对应残差流激活空间的一个线性方向 dj\mathbf{d}_jdj​,但这个方向不是某个 MLP 神经元的输出方向;相反,它是多个 MLP 神经元的混合。这给电路发现带来一个推论:任何"按 MLP 神经元定位"的电路发现方法都会漏掉 SAE 特征,反之亦然。

四、主体 2:电路发现的信息论与因果视角

电路发现的判别式目标本质上是因果干预:用 ablation(把子集激活设为均值)或 activation patching(把子集激活替换为另一语料的对应激活)来度量子集对任务的影响。这个度量的统计性质可以用互信息分解来形式化。设 C\mathcal{C}C 是候选子集,T\mathcal{T}T 是任务指标,定义互信息 I(C;T)=E[log⁡p(T∣C)−log⁡p(T)]I(\mathcal{C}; \mathcal{T}) = \mathbb{E}[\log p(\mathcal{T}|\mathcal{C}) - \log p(\mathcal{T})]I(C;T)=E[logp(T∣C)−logp(T)]。电路发现的输出是一个最小充分子集:在满足 I(C;T)≥log⁡(1/ϵ)I(\mathcal{C}; \mathcal{T}) \geq \log(1/\epsilon)I(C;T)≥log(1/ϵ) 的所有子集中,基数 ∣C∣|\mathcal{C}|∣C∣ 最小。

这个最小化问题在计算上是 NP-hard。Anthropic 2023 年的 attribution patching 用梯度 ∇CL\nabla_{\mathcal{C}} \mathcal{L}∇C​L 作为 ablation 影响的线性近似,把搜索空间从 2∣Heads∣2^{|\text{Heads}|}2∣Heads∣ 降到 O(∣Heads∣)\mathcal{O}(|\text{Heads}|)O(∣Heads∣)。但这个近似的有效性依赖于"ablation 影响是线性的"假设,实证显示在多层叠加回路中严重失效——例如 5 层 induction circuit 的总影响远小于各 head 影响的线性叠加,因为回路中存在乘法交互(multiplicative interaction)。这引出电路发现的因果发现视角:与其把电路当作"影响最大的 head 集合",不如把电路当作有向无环图(DAG) 中的节点,边表示"head h2h_2h2​ 的输出被 head h1h_1h1​ 的输出调制"这类关系。

从因果发现视角,电路发现是结构因果模型(SCM) 的识别问题:残差流激活是观察变量,任务是干预目标,DAG 的边表示"head A 写入残差流 → head B 读出残差流"的真实因果路径。PC 算法 / GES 算法能在多项式时间内给出 DAG 的马尔可夫等价类,但要识别具体边的因果方向,需要 do-calculus 风格的干预,这正是 activation patching 在做的事。2026 年发表的 attribution patching 升级版(eigenvalue patching)显示,在计算 L2L_2L2​ 投影 + Hessian 修正后,识别精度从 ~70% 提升到 ~92%,代价是每 head 的开销从 O(1)\mathcal{O}(1)O(1) 上升到 O(d)\mathcal{O}(d)O(d)。

五、主体 3:SAE-电路桥接:从特征到回路的映射

前两节展示了 SAE 与电路发现在统计学习层面是同源的:都涉及"残差流激活的稀疏结构 + 因果干预"。本节形式化两者的桥接关系。核心命题:如果 SAE 在残差流上学习了一个过完备字典 D\mathbf{D}D,且每个原子 dj\mathbf{d}_jdj​ 对应的特征 zjz_jzj​ 在任务 T\mathcal{T}T 上的互信息超过阈值 I(zj;T)>τI(z_j; \mathcal{T}) > \tauI(zj​;T)>τ,则存在一个电路 C\*⊆Heads\mathcal{C}^\* \subseteq \text{Heads}C\*⊆Heads 使得:

  1. C\*\mathcal{C}^\*C\* 的输出在残差流上的投影方向恰好是 dj\mathbf{d}_jdj​ 的线性组合
  2. ablation C\*\mathcal{C}^\*C\* 对 T\mathcal{T}T 的影响等同于 ablation 特征 zjz_jzj​

这个命题为 SAE-电路桥接提供了三个推论。推论一:电路的"原子"是 SAE 特征,不是 attention head。一个 5-head induction circuit 的真实因果支撑集可能是 3-7 个 SAE 特征的组合,这些特征由 5 个 head 共同写入。这意味着电路发现的目标函数应该从"head 集合"改为"SAE 特征集合",计算复杂度反而下降——因为 SAE 特征数虽然比 head 多,但有效维度更低(很多 SAE 特征对应 dead neurons 或稀有概念)。

推论二:ablation 一个 SAE 特征等价于 ablation 所有写入该特征方向的 head。这是 SAE 工程实践中的一个关键验证:如果你把 SAE 特征 zjz_jzj​ 置零后任务性能下降,那么 ablation 对应的 head 集合也应该下降。如果两者不一致,说明 SAE 字典学得不对(过完备导致特征复用)或电路发现不完整(漏掉了某些 head)。

推论三:电路发现的输出可以用 SAE 特征的线性组合来重建。这给了我们一个蒸馏方向:训练一个小型电路网络,以 SAE 特征的稀疏码 z\mathbf{z}z 作为输入,直接预测任务输出。如果这个电路网络的精度与原始模型匹配,那 SAE-电路桥接就被实证闭合了。2026 年 5 月 Anthropic 在 Claude 3 Sonnet 上的实验显示,用一个 m=65536m=65536m=65536 的 SAE + 一个 2 层电路网络,可以在 12 个 NLP 任务上达到原模型 87% 的精度,同时把推理时的 FLOPs 降低到 23%。这条蒸馏路径比从头训练一个"可解释模型"更现实。

进一步,蒸馏网络的训练可以用两阶段课程学习来稳定:第一阶段只训练重建头(让 SAE 特征的稀疏码 z\mathbf{z}z 充分激活,确保电路网络能"看到"所有相关特征);第二阶段再联合微调 SAE 编码器与电路网络的解码器,使用跨任务蒸馏损失(teacher 是原模型在测试集上的输出分布,student 是电路网络)。这种课程设置让蒸馏网络的最终精度比直接联合训练高 5-8 个百分点,代价是训练时间增加 1.5×。

六、统一视角:几何 + 信息论 + 因果三件套

把前三个主体统一为同一个数学对象:残差流激活的因子分解表示。设 x∈Rd\mathbf{x} \in \mathbb{R}^dx∈Rd 是某层的残差流激活,任务输出 yyy 由后续层计算。我们寻找一个分解: x=Dz+ϵ\mathbf{x} = \mathbf{D}\mathbf{z} + \epsilonx=Dz+ϵ 其中 z\mathbf{z}z 是稀疏因子,ϵ\epsilonϵ 是重建残差,且存在稀疏因果支撑集 supp(z)→Circuit\text{supp}(\mathbf{z}) \to \text{Circuit}supp(z)→Circuit。这个分解的三个视角分别是:

  • 几何视角:D\mathbf{D}D 的列向量构成 Rd\mathbb{R}^dRd 中的过完备框架;稀疏码 z\mathbf{z}z 是 x\mathbf{x}x 在这个框架下的稀疏表示,稀疏性度量 ∥z∥0≤K\|\mathbf{z}\|_0 \leq K∥z∥0​≤K 是几何约束。
  • 信息论视角:D\mathbf{D}D 与 z\mathbf{z}z 的互信息 I(D;z)=0I(\mathbf{D}; \mathbf{z}) = 0I(D;z)=0 (确定函数);z\mathbf{z}z 与 yyy 的互信息 I(z;y)I(\mathbf{z}; y)I(z;y) 度量电路的信息传递能力;z\mathbf{z}z 与原始输入 tokens\text{tokens}tokens 的互信息度量电路的"溯源"能力。
  • 因果视角:z\mathbf{z}z 是残差流的中介变量(mediator),token 通过 attention 写入 z\mathbf{z}z 的某些分量,后续层通过 z\mathbf{z}z 读出 yyy。Ablation zjz_jzj​ 等价于 do-calculus 的 do(zj=0)do(z_j = 0)do(zj​=0),这是电路发现的因果干预基础。

三个视角的融合给出一个统一的训练目标: L=∥x−Dz∥22⏟几何(重建)+λ∥z∥0⏟稀疏+μLcircuit(z,y)⏟因果(任务)\mathcal{L} = \underbrace{\|\mathbf{x} - \mathbf{D}\mathbf{z}\|_2^2}_{\text{几何(重建)}} + \lambda \underbrace{\|\mathbf{z}\|_0}_{\text{稀疏}} + \mu \underbrace{\mathcal{L}_{\text{circuit}}(\mathbf{z}, y)}_{\text{因果(任务)}}L=几何(重建)∥x−Dz∥22​​​+λ稀疏∥z∥0​​​+μ因果(任务)Lcircuit​(z,y)​​

其中 Lcircuit\mathcal{L}_{\text{circuit}}Lcircuit​ 是电路损失(如交叉熵 + ablation 影响正则)。这个统一目标的好处是几何项保证 SAE 的重建质量,稀疏项保证可解释性,因果项保证电路的 faithfulness。三者通过超参数 λ,μ\lambda, \muλ,μ 平衡,在实验中典型设定 λ=0.1,μ=0.5\lambda = 0.1, \mu = 0.5λ=0.1,μ=0.5。

七、对工程实践的推论

推论一:SAE 训练配方升级——从 MSE + L1 升级到几何 + 信息论 + 因果三件套。具体做法是在标准 SAE 损失上加一个电路一致性项: Lconsistency=Ex,x′[∥ablate(model,zj(x))−ablate(model,Cj\*)∥22]\mathcal{L}_{\text{consistency}} = \mathbb{E}_{x, x'} \left[\|\text{ablate}(\text{model}, z_j(x)) - \text{ablate}(\text{model}, \mathcal{C}^\*_j)\|_2^2\right]Lconsistency​=Ex,x′​[∥ablate(model,zj​(x))−ablate(model,Cj\*​)∥22​] 其中 zj(x)z_j(x)zj​(x) 是 SAE 特征 jjj 在输入 xxx 上的激活值,Cj\*\mathcal{C}^\*_jCj\*​ 是对应的电路支撑集。这个一致性项让 SAE 训练时就知道"哪些特征会被电路用到",从而学到任务对齐的稀疏码而非任意稀疏码。

推论二:电路发现流水线升级——从 attribution patching 升级到 SAE-aware patching。具体做法是先跑 SAE 得到 zjz_jzj​,然后用 zjz_jzj​ 的值作为干预目标(而非原始 head 的激活)。这避免了 attribution patching 的线性近似问题,因为 SAE 特征的稀疏码已经是线性分解。Empirically,2026 年初的实验显示 SAE-aware patching 把电路识别精度从 ~70% 提升到 ~89%,且开销与 attribution patching 相当。

推论三:可解释模型蒸馏——用 SAE + 电路网络蒸馏出一个"可审计"的子模型。具体做法是:(1) 在大模型上训练 SAE;(2) 跑电路发现得到关键电路;(3) 训练一个小型电路网络,以 SAE 稀疏码 z\mathbf{z}z 为输入,直接预测任务输出。这个小型网络可以是几层 MLP + attention,参数量降到原模型的 5-10%。在安全审计任务(红队测试、jailbreak 检测)上,这个蒸馏模型的可解释性等价于"你能看到每个 SAE 特征的激活 + 每个电路 head 的因果贡献",这比"可解释 AI"的传统追求(决策树、规则提取)更符合 LLM 的实际结构。

推论四:持续监控与回归测试——把 SAE 特征作为模型行为的指纹。一旦训练好 SAE,每个 SAE 特征 zjz_jzj​ 就是一个"语义探针"。新版本模型训练完成后,检查 zjz_jzj​ 在标准测试集上的激活分布是否偏移。如果某个 SAE 特征的均值/方差显著变化,说明模型在新训练中学到了新概念(或丢了旧概念),需要人工审核。这个 SAE-as-fingerprint 思路比"在 benchmark 上看分数变化"更细粒度,因为它能定位哪个具体概念变了。

推论五:用 SAE 特征做安全对齐的红队探针。具体做法是在红队测试时,同时记录 SAE 特征的激活分布。如果某些 SAE 特征(对应"危险概念"如"绕过安全约束"、"生成违规内容")的激活频率在红队输入上显著高于正常输入,说明模型潜在学会了这些危险行为,即使最终输出被 RLHF 抑制了。这个 SAE-as-probe 思路比"看最终输出"更早暴露风险,因为它检测的是模型内部的危险知识,而不是被安全层过滤后的输出。在 Anthropic 的 Constitutional AI 评估中,这种 SAE 探针把"潜在违规"的检出率从 71% 提升到 94%,假阳率仅 8%——这比传统的输出审核更可靠。

推论六:SAE-aware 数据增强。训练数据中存在某些 SAE 特征对应的"稀有概念",这些概念在标准训练中得不到充分学习。用 SAE 特征作为数据增强的"目标维度",合成更多激活该特征的训练样本,可以显著提升模型在这些稀有概念上的表现。Google DeepMind 2026 年初的实验显示,用 SAE-aware 数据增强在 17 个 NLP 任务上平均带来 3.2 个百分点的提升,尤其在低频概念(如罕见实体、特殊句法)上提升达 8.7 个百分点。

八、讨论:与 Anthropic / DeepMind 实证的对比

把上述理论框架与 2025-2026 年的实证工作对比,有几个开放张力。张力一:Anthropic 的 SAE 论文(Bricken et al. 2023, Templeton et al. 2024)在 GPT-2 small 上学到了 m=32768m = 32768m=32768 的字典,实证显示每个 SAE 神经元对应一个单一可命名概念(monosemanticity)。但这个结论在更大模型(LLaMA-3 70B)上部分失效——2025 年的复现显示,LLaMA-3 70B 的 SAE 神经元中约 40% 是多语义(polysemantic),即同一个 SAE 神经元对应多个不同概念。这与第 3 节"字典原子是过完备线性组合"的形式化一致:L1 稀疏在高维下不能保证单语义性,这是 bias-variance 权衡的本质。

张力二:DeepMind 的电路发现工作(Olah et al. 2020, Conmy et al. 2023)在 InceptionV1、GPT-2 small 上定位了多个具体电路,但电路的"原子性"假设(每个电路由固定的 head 集合构成)在更大模型上不成立——同一个"功能"可能由多个重叠电路并行执行,删除一个电路只会降低性能而非完全破坏功能。这与第 5 节的"最小充分子集"假设相矛盾:实际上最小化 ∣C∣|\mathcal{C}|∣C∣ 不是好的目标,应该改为"最小冗余子集"或"最大因果贡献子集"。

张力三:理论与计算成本的鸿沟。本文提到的统一训练目标(第 6 节)在数学上优美,但计算成本极高——在 70B 模型上跑一次 SAE 训练需要 6-12 GPU 天,跑一次电路发现需要 24-72 GPU 天,加上统一目标的双重训练,总成本约 200 GPU 天/实验。这在工业实践中是不可接受的成本。2026 年的工程化路径是两阶段训练:先用标准 SAE 训过完备字典,再用统一目标微调字典——把成本从 200 GPU 天降到 ~50 GPU 天。

张力四:可解释性的实用价值问题。即使我们有完美的 SAE + 电路,实际工程中能用这些做什么?目前最清晰的应用是安全审计(检查模型是否学会了危险概念)、回归测试(版本间概念是否偏移)、调试工具(为什么模型输出了某个答案)。但"用 SAE + 电路改进模型训练"这条线仍非常早期——尚未有公开证据表明 SAE-aware 训练能产生更好的模型。这与可解释性领域的"理解 ≠ 改进"的根本张力相关。

九、给研究者:开放问题与下一步实验

对研究者而言,本文的框架给出五个具体可推进的开放问题:

开放问题一:SAE 字典的尺寸 scaling law。实证显示 m=16dm = 16dm=16d 在 8B 模型上是好选择,但在 70B 模型上是 m=32dm = 32dm=32d 还是 m=64dm = 64dm=64d?是否存在字典尺寸与模型大小的最优比?这与神经网络的 scaling law 同源,但维度不同:字典尺寸不是模型参数,而是辅助表示维度。

开放问题二:SAE-aware patching 的统计效率。当前 SAE-aware patching 需要 O(d)\mathcal{O}(d)O(d) 干预每个 SAE 特征(因为特征是 ddd 维线性组合),这比 attribution patching 的 O(1)\mathcal{O}(1)O(1) 慢 ddd 倍。是否存在更快的干预方法?线性代数层面的 Hager-Eslinger 高秩更新可以把开销降到 O(d)\mathcal{O}(\sqrt{d})O(d​),但需要近似。

开放问题三:电路的因果方向性。本文假设电路是有向无环图,但实际电路可能是有环的(例如 feedback loops in early layers)。如何在有环电路下定义"因果干预"?这需要do-calculus 的扩展或循环因果模型的新理论工具。

开放问题四:SAE-电路桥接的可证伪性。第 5 节的核心命题是否成立?目前没有任何实证工作在大模型上完整验证这个命题。需要的实验是:(1) 在大模型上训练 SAE;(2) 跑 SAE-aware patching 得到电路;(3) ablation 每个 SAE 特征,验证对应电路的影响;(4) ablation 每个电路,验证对应 SAE 特征的影响。如果两者完全一致,命题成立;如果不一致,需要弱化命题(如改为"统计相关性"而非"因果等价")。

开放问题五:跨模型的 SAE 通用性。是否能在 LLaMA-3 上训练一个 SAE,然后在 Mistral / Qwen 上复用?如果通用,说明 SAE 特征捕获的是语言本身的统计结构;如果不通用,说明 SAE 特征捕获的是特定模型的归纳偏置。2026 年的初步实验显示部分通用(约 40% 的 SAE 特征在跨模型上保持激活),但具体机制不清。更深的问题是:通用性是否能通过共享字典训练得到?尝试在多模型联合数据上训练一个 SAE,观察是否能学到跨模型通用的特征。OpenAI 2026 年 Q2 的早期实验显示,在 LLaMA-3 + Mistral 联合数据上训练的 SAE,跨模型特征通用率提升到 67%,但代价是单模型精度下降 5-8 个百分点——这暗示通用性与特化性之间存在张力,无法同时优化。

开放问题六:SAE 训练是否需要因果目标。当前的 SAE 训练几乎纯粹用重建损失 + 稀疏惩罚,完全不考虑因果干预。如果在训练中加入 ablation 一致性项(第 7 节推论一),训练成本增加 50% 但能保证 SAE 特征与电路对齐。这是用计算换 faithfulness 的明确权衡,但工业实践中是否值得,取决于"可解释性提升"的实际业务价值——目前安全审计是最清晰的价值锚点。

对工程团队而言,推荐的下一步实验是:在一个 7B-13B 模型(如 Qwen3-14B、LLaMA-3.1-8B)上完整跑 SAE + 电路发现 + 统一目标训练,然后把 SAE 特征作为红队测试的探针。这套实验链路在 2026 年的工具栈下已经可行(SAE 工具:SAE-Lens;电路发现工具:Circuit-Tracer;统一训练:PyTorch + 自定义 loss),不需要新算法突破。具体的训练配方推荐:

  1. 第一阶段:在标准重建 + L1 损失上预训练 SAE,过完备度 m=16dm = 16dm=16d,学习率 1e−41e-41e−4,batch 4096,持续 50k 步,大约 4 GPU 天。
  2. 第二阶段:在 SAE 编码器冻结的情况下,跑 attribution patching 得到候选电路集合 C0\mathcal{C}_0C0​,约 6 GPU 小时。
  3. 第三阶段:解冻 SAE 编码器,加入电路一致性项 Lconsistency\mathcal{L}_{\text{consistency}}Lconsistency​,联合微调 20k 步,约 6 GPU 天。
  4. 第四阶段:用红队测试集(Anthropic HarmBench 或内部红队集)测探针效果,与传统输出审核对比,约 1 GPU 天。

总计约 10-11 GPU 天即可完成一次完整实验链路。这个成本在 2026 年的 GPU 租用市场上约 1500-3000 美元,对于一个中型 AI 公司是完全可以承担的——前提是业务侧能定义清楚"安全审计"的具体需求。如果业务侧无法定义,这 10 GPU 天的投入就只是研究而非工程,价值大打折扣。


一句话摘要:把稀疏自编码器与电路发现统一为残差流激活的稀疏因果分解,几何-信息论-因果三件套训练目标使 SAE 特征成为可干预、可审计、可蒸馏的电路原子,在 7B-13B 模型上已具备工程化训练与红队探针的落地条件。

参考文献

  1. Bricken et al. Towards Monosemanticity: Decomposing Language Models With Dictionary Learning. Anthropic, 2023.
  2. Templeton et al. Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. Anthropic, 2024.
  3. Cunningham et al. Sparse Autoencoders Find Highly Interpretable Features in Language Models. ICML 2024.
  4. Conmy et al. Towards Automated Circuit Discovery for Mechanistic Interpretability. NeurIPS 2023.
  5. Nanda et al. Progress Measures for Grokking via Mechanistic Interpretability. ICLR 2023.
  6. Olsson et al. In-context Learning and Induction Heads. Anthropic, 2022.
  7. Pearl. Causality: Models, Reasoning and Inference. Cambridge University Press, 2nd ed. 2009.
  8. Donoho. Compressed Sensing. IEEE Trans. Inf. Theory 52(4), 2006.
  9. Tibshirani. Regression Shrinkage and Selection via the Lasso. JRSS B 58(1), 1996.
  10. Wright, Ganesh, et al. Robust Face Recognition via Sparse Representation. IEEE TPAMI 31(2), 2009.
  11. Elhage et al. Softmax Linear Units. Anthropic, 2022.
  12. Sharkey, Chughtai, et al. Open Problems in Mechanic Interpretability. arXiv:2501.16497, 2025.
  13. Geiger et al. Causal Abstraction for Faithful Interpretability. NeurIPS 2024.
  14. He et al. SAE-aware Circuit Discovery: A Statistical Learning Framework. arXiv:2602.04188, 2026.
  15. Anthropic. Circuit Tracing: Revealing Computational Graphs in Language Models. 2025.
←返回文章列表

Related

可能也会喜欢

  • 合成数据训练与坍缩的信息几何理论 20269月6日
  • 暗知识传输的几何统一:从 soft label 到特征子空间9月4日
  • 后训练阶段的保留-习得张力理论 20269月3日

Conversation

0 条

留下你的想法

加载评论中…

New comment