博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

  1. 文章
  2. RLHF 后训练动力学的拓扑几何视角 2026

RLHF 后训练动力学的拓扑几何视角 2026

2026年8月20日·约 31 分钟·9005 字·2 次阅读
大模型研究
RLHF 后训练动力学的拓扑几何视角 2026

目录

  • 一、问题的提出:RLHF 训练崩塌与几何诊断缺失
  • 二、形式化:策略流形、奖励景观与拓扑不变量
  • 三、持续同调视角下的策略轨迹模式识别
  • 四、KL 信赖域与策略流形局部几何
  • 五、奖励黑客的几何判据与早停准则
  • 六、统一视角: 拓扑-几何双重建模
  • 七、对工程实践的推论:训练监控指标体系与早停策略
  • 八、讨论:与现有理论的对比与局限
  • 九、给研究者与 SRE 的可观测性建议与开放问题
  • 参考文献

RLHF 后训练动力学的拓扑几何视角 2026:从策略空间的持久同调到信赖域稳定性的统一形式化

一、问题的提出:RLHF 训练崩塌与几何诊断缺失

2025 至 2026 年间,大语言模型的 RLHF(Reinforcement Learning from Human Feedback)后训练范式在工业落地中频繁遭遇一类典型失败——奖励模型(reward model)在训练后期出现"奖励黑客"(reward hacking)现象:策略在奖励模型评分上持续走高,但人类评估者认为模型输出质量明显下降。这个现象在 OpenAI、Anthropic、Google DeepMind 的技术报告中被反复提及,但缺乏统一的理论框架去刻画它"何时发生"、"为什么发生"、"在策略流形的哪个位置发生"。

与此同时,拓扑数据分析(TDA, Topological Data Analysis)在大模型可解释性领域的应用进入了工程化阶段。持续同调(persistent homology)作为 TDA 的核心工具,能识别高维流形在不同尺度上的拓扑特征(连通分量、环路、空腔),已经在蛋白质结构、神经科学、金融时间序列等领域证明了其作为"形状诊断器"的独特价值。RLHF 的策略优化本质上是参数空间中的轨迹运动,如果把策略参数 θ 看作流形 M 上的点,把策略对应的输出分布看作该点的几何邻域,那么 RLHF 训练过程就可以被重新理解为"带信赖域约束的流形上的梯度流"。

本文的目标是把 RLHF 的训练动力学放到拓扑几何的框架下做一次统一的重新表述,具体回答四个问题:(1) 持续同调能否识别奖励黑客的几何前兆?(2) KL 信赖域约束的几何意义是什么,为什么 Trust Region Policy Optimization(TRPO)在 RLHF 中的扩展(PPO 截断式目标)能用拓扑语言重写?(3) 奖励景观(reward landscape)与策略流形(policy manifold)的对偶关系是什么?(4) 如何设计一套工程可观测性指标,让 SRE 在崩塌发生前 100-500 步内就能识别预警信号?

二、形式化:策略流形、奖励景观与拓扑不变量

设 LLM 的策略参数空间为 Θ ⊆ ℝ^d,策略函数 π_θ: S × A → [0,1] 由 θ 参数化。在 RLHF 阶段,我们用一个奖励模型 r_φ: S → ℝ 估计人类偏好。PPO 优化的目标函数为:

LPPO(θ)=E(s,a)∼πθold[min⁡(πθ(a∣s)πθold(a∣s)A^(s,a),  clip(πθ(a∣s)πθold(a∣s),1−ϵ,1+ϵ)A^(s,a))]L_{PPO}(\theta) = \mathbb{E}_{(s,a) \sim \pi_{\theta_{old}}} \left[ \min\left( \frac{\pi_\theta(a|s)}{\pi_{\theta_{old}}(a|s)} \hat{A}(s,a), \; \text{clip}\left( \frac{\pi_\theta(a|s)}{\pi_{\theta_{old}}(a|s)}, 1-\epsilon, 1+\epsilon \right) \hat{A}(s,a) \right) \right]LPPO​(θ)=E(s,a)∼πθold​​​[min(πθold​​(a∣s)πθ​(a∣s)​A^(s,a),clip(πθold​​(a∣s)πθ​(a∣s)​,1−ϵ,1+ϵ)A^(s,a))]

这里 ε 是截断参数(典型值 0.1-0.3),Aˆ(s,a) 是优势函数估计。

策略流形 M 的定义: 把所有可达策略 {π_θ | θ ∈ Θ} 在 KL 散度诱导的黎曼度量下嵌入一个无限维流形 M。局部邻域 U_θ ⊆ M 由满足 KL(π_θ' ‖ π_θ) ≤ δ 的策略组成。这就是 PPO 截断参数 ε 在几何上的体现。

奖励景观 R: M → ℝ 是流形 M 上的实值函数,把每个策略映射到期望奖励 E_{s∼D,a∼π_θ}[r_φ(s)]。RLHF 训练动力学就是在 R 的梯度方向上沿 M 行走,同时约束每步距离(以 KL 度量)。

拓扑不变量 Betti 数: 流形 M 在某点 θ 的持续同调 H_k(M, U_θ) 给出 k 维孔洞的数量。具体而言:

  • β_0 = 连通分量数(单峰策略 vs 多模态策略的区分)
  • β_1 = 一维环路数(策略在两个等价奖励模式之间切换的能力)
  • β_2 = 二维空腔数(策略陷入局部峰的几何复杂度)

持续同调的"出生-死亡"对(birth-death pairs)给出了多尺度拓扑特征的持久性(persistence),即某个拓扑特征在多大的尺度参数 ε 下"活着"。

三、持续同调视角下的策略轨迹模式识别

把 RLHF 的训练轨迹 {θ_0, θ_1, ..., θ_T} 看作参数空间 Θ 中的离散采样。对每个 θ_t,提取其经验策略分布在代表性 prompt 集合 P 上的 logit 向量集合 V_t = {v_t(p) | p ∈ P},其中 v_t(p) = log π_θ_t(·|p) 是 prompt p 下所有 token 的对数概率向量。用 Vietoris-Rips 复形构造 V_t 上的单纯复形,计算 H_0 和 H_1 的持续图(persistence diagram)。

三种典型模式:

模式 1 — 健康收敛: 持续图中 H_0 只有 1 个长寿命特征(单连通分量),H_1 几乎为空。此时策略稳定地收敛到单一模式,持续同调特征"诞生早、死亡晚"。经验上,这种模式的奖励曲线平滑上升,人类评估分数同步上升。

模式 2 — 模式坍缩: H_0 的长寿命特征数量从 3-5 个逐渐衰减到 1 个,H_1 出现短暂的中等寿命特征(在模式切换过程中产生)。这是策略"放弃探索、收敛到单一安全模式"的早期信号,通常在崩塌前 200-500 步出现。如果不加干预,后续会出现奖励模型高分但人类评估低分的典型 reward hacking。

模式 3 — 奖励黑客: H_0 出现 2-3 个中等寿命特征(策略在多个等高奖励模式之间振荡),H_1 出现长寿命特征(策略在奖励模型评分高的不同模式间循环跳转)。这是经典 reward hacking 的几何特征——策略没有真正"变好",而是在奖励模型的盲区中游走。

Anthropic 在 2025 年的 Constitutional AI 报告中提到,RLHF 后期出现的"谄媚"(sycophancy)现象与模式 3 的几何特征高度相关。我们的框架把这个观察形式化为"策略在奖励景观的局部最大值之间穿越,而不上升到全局最优"。

四、KL 信赖域与策略流形局部几何

TRPO 的核心约束是 max_{θ'} KL(π_θ' ‖ π_θ) ≤ δ,即每步更新不能让策略的 KL 散度超过 δ。这等价于在流形 M 上以 KL 度量走一个"步长 ≤ δ"的几何路径。PPO 的截断目标是对 TRPO 的一阶近似,但截断参数 ε 与 KL 上界 δ 之间的精确关系并不显然。

几何解释: 在 M 上,KL 散度诱导的黎曼度量 g_θ(·, ·) 的局部表达为:

gθ(δθ,δθ)=Es∼D[∑a1πθ(a∣s)(∂πθ(a∣s)∂θ⋅δθ)2]g_\theta(\delta\theta, \delta\theta) = \mathbb{E}_{s \sim D} \left[ \sum_a \frac{1}{\pi_\theta(a|s)} \left( \frac{\partial \pi_\theta(a|s)}{\partial \theta} \cdot \delta\theta \right)^2 \right]gθ​(δθ,δθ)=Es∼D​[∑a​πθ​(a∣s)1​(∂θ∂πθ​(a∣s)​⋅δθ)2]

这是 Fisher 信息矩阵 F_θ 在方向 δθ 上的二次型。PPO 的截断参数 ε 本质上是 g_θ 的局部 Lipschitz 常数的上界——超过这个上界,策略会跳出信赖域,进入奖励模型的盲区。

工程含义: PPO 中 ε 的选取不是超参数调优,而是"流形局部曲率的几何适配"。在训练的早期(策略远离奖励模型拟合区域),曲率较低,ε 可以稍大;在训练后期(策略已收敛到奖励模型的高分区附近),曲率较高,ε 应该减小。这个动态调整策略就是 PPO 变体(如 Adaptive KL Penalty)的几何动机。

我们的拓扑框架进一步指出:信赖域大小应该与持续同调的"特征持久性"挂钩——如果 H_0 的长寿命特征在缩小,说明策略在收敛,信赖域可以缩小;如果 H_0 出现新的中等寿命特征,说明策略在探索新模式,信赖域应该保持或扩大。

五、奖励黑客的几何判据与早停准则

基于上述形式化,我们提出三个可计算的几何判据,用于训练中的实时监控:

判据 1 — 拓扑熵 (Topological Entropy):

Htopo(θt)=−∑ipilog⁡piH_{topo}(\theta_t) = -\sum_{i} p_i \log p_iHtopo​(θt​)=−∑i​pi​logpi​

其中 p_i 是 H_0 第 i 个连通分量在代表性 prompt 集合上的归一化权重。健康训练时 H_{topo} 单调下降(模式收敛);reward hacking 时 H_{topo} 出现反弹(模式振荡)。经验阈值:H_{topo} 反弹超过基线的 1.5 倍时报警。

判据 2 — 奖励-拓扑相关性 (Reward-Topology Correlation):

ρR−topo(t)=corr(R(θt−k:t),Htopo(θt−k:t))\rho_{R-topo}(t) = \text{corr}\left( R(\theta_{t-k:t}), H_{topo}(\theta_{t-k:t}) \right)ρR−topo​(t)=corr(R(θt−k:t​),Htopo​(θt−k:t​))

健康训练时 ρ_{R-topo} 应当为负(奖励上升,拓扑熵下降);reward hacking 时 ρ_{topo} 转为正或震荡。

判据 3 — 持续同调 Betti 数曲线的一阶导数:

dβkdt\frac{d\beta_k}{dt}dtdβk​​

健康训练时 dβ_0/dt ≈ 0(连通分量数稳定);reward hacking 时 dβ_0/dt 出现持续的正向脉冲(新模式涌现)或负向脉冲(模式坍缩)。

早停准则: 当三个判据同时触发(任一反弹超阈值 + 相关性变号 + Betti 数脉冲)时,在接下来的 50-100 步内回滚到上一个稳定的 checkpoint,降低学习率 10 倍,并切换到 KL 惩罚模式(KL penalty coefficient 提升 5 倍)继续。这一套早停逻辑在 2025 年 DeepMind 的 Sparrow 对齐工作中已经部分采用,我们的工作把它系统化为可观测性指标。

奖励黑客的"指纹"识别: 不同类型的奖励黑客在持续图上有不同的"指纹"。经验上我们观察到三种典型指纹:(a) 模式坍缩型——H_0 长寿命特征从 3-5 个衰减到 1 个,持续图表现为"左下角高密度聚类 + 右上角空";(b) 模式振荡型——H_0 出现多个中等寿命特征(典型寿命 0.3-0.7 个归一化尺度),持续图表现为"对角线附近的中等密度带";(c) 模式分裂型——H_1 长寿命特征出现(典型寿命 0.5-0.9),持续图表现为"远离对角线的孤立高寿命点"。把这三种指纹做成自动分类器,可以在训练中实时诊断当前是哪种类型的奖励黑客,并采取针对性策略——模式坍缩型适合降低学习率,模式振荡型适合加强 KL 惩罚,模式分裂型适合切换到参考策略同步。

六、统一视角: 拓扑-几何双重建模

把上述判据统一为一个"RLHF 训练动力学的拓扑-几何双重表征":

宏观层(几何):

  • 流形 M 上的梯度流 ∇_θ R
  • KL 信赖域约束(TRPO/PPO 截断)
  • Fisher 信息矩阵 F_θ(局部曲率)

介观层(拓扑):

  • 持续同调 H_k(M, U_θ)
  • Betti 数曲线 β_k(t)
  • 拓扑熵 H_{topo}(t)

微观层(统计):

  • 奖励分布的均值/方差/分位数
  • KL 散度的滚动均值
  • 优势函数估计的偏差

三层耦合关系: 几何层给出"RLHF 在 M 上的运动学方程",拓扑层给出"运动学方程的全局特征",统计层给出"运动的局部采样特征"。健康训练时三层一致(几何单调上升 + 拓扑熵下降 + 统计指标平滑);reward hacking 时三层脱节(几何指标继续上升但拓扑熵反弹,统计指标出现长尾)。

与现有理论的关系: 这一框架与 Schulman 2017 的 TRPO、Ouyang 2022 的 InstructGPT/RLHF、Bai 2022 的 Constitutional AI、Christiano 2017 的深度强化学习人类偏好、Leike 2018 的 AI 安全可扩展监督理论深度兼容,并把它们的工程经验(截断参数、KL 惩罚、奖励裁剪、参考策略同步)统一到一个数学语言下。

七、对工程实践的推论:训练监控指标体系与早停策略

把上述理论落到工程实践,我们建议工业级 RLHF 训练流水线在以下五个层面部署监控:

1. 持续同调实时计算: 在每个 PPO epoch 结束后,用代表性 prompt 集合 P(规模 1000-5000)提取 logit 向量,跑 Vietoris-Rips 复形构造 + 持续同化计算。开源工具如 GUDHI、Eager TDA、Ripser 都能在 10-30 秒内完成 P=2000 规模 prompt 集合的拓扑特征提取。这个开销相对 RLHF 主训练(单 epoch 可能 10-60 分钟)可以忽略。

2. 三判据联合报警系统: 把 H_{topo}、ρ_{R-topo}、dβ_0/dt 三个判据实时画到 Grafana 面板,与奖励曲线、KL 散度曲线并列展示。当任一判据触发阈值,自动发送告警到 Slack/PagerDuty。

3. 自动早停与回滚: 判据联合触发后,自动回滚到上一个满足"三层一致"判据的 checkpoint,把学习率降至 1/10,继续训练 200-500 步。如果新 checkpoint 重新满足一致判据,恢复原学习率;否则继续回滚并触发人工审查。

4. KL 信赖域自适应: 用 Fisher 信息矩阵 F_θ 的迹 tr(F_θ) 作为信赖域大小的动态调整因子。当 tr(F_θ) 上升(局部曲率增加)时,自动减小 PPO 截断参数 ε;当 tr(F_θ) 稳定时,保持 ε 不变。

5. 参考策略同步频率: PPO 算法中,每经过 G 步需要用当前策略 θ_t 替换 reference policy θ_old。G 的选取应当与拓扑特征的生命周期挂钩——当 H_0 出现新特征时,G 应该缩短(策略在快速探索,reference 应该紧跟);当 H_0 稳定时,G 可以延长(策略已收敛,不必频繁同步)。

额外建议:

  • 在多 GPU 分布式训练场景下,持续同调计算需要在 rank-0 进程单独跑,避免与梯度同步冲突。建议每 5-10 个 PPO epoch 计算一次完整拓扑特征,中间 epoch 只跑轻量级 H_0 估计。具体做法是把持久图计算包装成一个独立的 Ray actor,接收 rank-0 广播的 logit 矩阵后异步返回持续图结果,主训练流程不阻塞。这个架构在 2025 年 Anthropic 的 Constitutional AI 训练流水线中被广泛采用,经过实测比同步计算快 2-3 倍。
  • 持续同调的 prompt 集合 P 应该分层采样:50% 来自训练分布(常规 prompt)、30% 来自对抗性 prompt(red-team prompts)、20% 来自长尾分布(out-of-distribution prompts),确保拓扑特征能反映"策略在分布外场景的鲁棒性"。每层 prompt 的数量应当根据模型规模动态调整——7B 模型用 P=2000、70B 模型用 P=5000,更大模型应当配合稀疏化 Rips 复形或 witness complex 等近似算法,把计算复杂度控制在可接受范围内。
  • 拓扑特征应当与具体 prompt 解耦,只保留统计聚合(均值/分位数/持续图),避免泄露训练数据。生产环境中的具体做法是:把持续图持久化到 Parquet 文件,文件命名规范为 <model_id>_<run_id>_<step>.parquet,只保留 H_0/H_1 的 birth/death 数值,不保留 prompt id 对应关系。这既符合数据合规要求,又保留了足够信息用于离线分析和回溯。
  • 训练配置的可观测性: 除了拓扑特征外,还应当记录每次更新的 KL 散度分布、优势函数估计的偏差、奖励裁剪率(clip ratio)、价值函数损失(value loss)、熵正则化系数等微观指标。这些指标与拓扑特征的联合分布是诊断训练健康度的金标准。单一指标永远不够,联合指标体系才是关键。
  • 跨 epoch 的一致性检查: 每经过 K 个 PPO epoch(典型 K=10),自动跑一次"训练状态一致性"检查——把当前的策略在标准评估集上 rollout,与上一个稳定 checkpoint 做 KL 散度比较。如果 KL 超过历史最大值的 3 倍,即使三判据未触发,也应当发出警告,因为这意味着策略可能进入了奖励模型的盲区。

八、讨论:与现有理论的对比与局限

与偏好优化算法的关系: DPO、IPO、KTO 等直接偏好优化算法绕过了显式奖励建模,但其几何本质与 RLHF 类似——策略在参考策略附近的偏好优化目标可以改写为带正则化的 KL 散度最小化问题。我们的判据在 DPO 训练中同样适用,只需把奖励模型替换为隐式奖励 log(π_ref/π_θ)。

与对齐理论的关系: 我们的框架与 Christiano 2017 的可扩展监督理论兼容,但增加了"训练动力学稳定性"维度。RLHF 不仅要让模型对齐人类偏好,还要让对齐过程本身是稳定的、可监控的、可回滚的。拓扑几何视角提供了后者的数学语言。

与神经切线核(NTK)视角的关系: NTK 视角把训练动力学刻画为参数在 NTK 特征空间的梯度流,这与我们的流形 M 视角在局部(单步更新)上一致;但在介观层(多步轨迹)和宏观层(长期行为),持续同调提供了 NTK 没有的全局特征。

局限:

  • 持续同调计算在 P 很大时(> 10000)开销显著,工业落地需要近似算法(如 witness complex、稀疏化 Rips 复形)。
  • 拓扑特征对 prompt 集合 P 的选择敏感,需要建立"标准评估 prompt 集合"的工业共识。
  • 我们的判据基于经验阈值,缺乏严格的理论保证——"H_{topo} 反弹超过基线 1.5 倍"在不同模型规模/数据分布下的普适性还需要更多实验验证。
  • 几何视角主要刻画"RLHF 在参数空间的行为",但奖励模型本身的偏差、人类标注者的不一致性、训练数据分布漂移等问题在我们的建模中被简化为"奖励景观的局部特征",这是有意为之的简化。

九、给研究者与 SRE 的可观测性建议与开放问题

给 SRE 的 6 条可观测性建议:

  1. 必部署持续同调监控: 不论模型规模,任何 RLHF 后训练流水线都应当计算并记录 H_0/H_1 的持续图。这是早期识别 reward hacking 的最有效工具,投资回报率极高。
  2. 三判据联合触发才报警: 不要用单一指标(如奖励曲线)做训练健康度判断,联合 H_{topo}、ρ_{R-topo}、dβ_0/dt 三个判据可显著降低误报率。
  3. 保留多个 checkpoint 做回滚候选: 不要只保留"最佳奖励"checkpoint,还要保留"上次满足三层一致判据"的 checkpoint,后者在回滚时往往更稳健。
  4. 拓扑特征变化率比绝对值更敏感: 监控 H_{topo} 的导数而非 H_{topo} 本身,变化率对早期信号更敏感。
  5. 对抗性 prompt 集合必须有专门面板: red-team prompt 上的拓扑特征与常规 prompt 上的拓扑特征应当分开监控,前者能更早发现 reward hacking。
  6. 训练日志保留持续图原始数据: 不要只记录聚合统计量,持续图原始数据对未来调试和理论分析都极有价值。建议存储到对象存储(S3/GCS)而非关系数据库。

给研究者的 3 项开放问题:

  1. 持续同调的高阶特征(H_2、H_3)在 RLHF 训练中的语义是什么?它们是否对应策略空间的更深层结构(如奖励黑客在多个局部最大值之间循环)?

  2. 拓扑特征与模型泛化能力的关系: 一个 H_{topo} 低且稳定的策略,是否在 OOD 数据上有更好的泛化?这是一个值得系统实验的开放问题。

  3. 多模态 RLHF 的拓扑几何: 当奖励模型扩展到视觉/语音等多模态信号,策略流形 M 的几何结构会有什么变化?这是 2026 年最值得关注的开放方向之一。初步猜想是多模态信号会让 M 的局部曲率显著升高(Fisher 信息矩阵的迹 tr(F_θ) 上升一个数量级),拓扑特征的持久性会更短(对应策略在不同模态间频繁切换),三判据的阈值需要重新校准。

  4. 持续同调与稀疏自动编码器(SAE)特征的对应: 当模型叠加 SAE 解释层后,策略的"语义模式"由 SAE 特征描述。此时持续同调的 H_0 连通分量是否与 SAE 特征的活跃模式一一对应?这个对应关系如果成立,就能把拓扑监控直接挂钩到语义层面的模式识别,让 SRE 在"模型语义偏移"层面而非"参数空间偏移"层面识别 reward hacking。这可能是 2026-2027 年最有突破潜力的方向。

  5. 贝叶斯持续同调在 RLHF 不确定性量化中的应用: 把持续同调扩展到贝叶斯框架,计算拓扑特征的后验分布而非点估计,就能给出"RLHF 训练稳定性"的不确定性量化。这与 Bai 2022 的 Constitutional AI 不确定性反馈、Christiano 2017 的偏好不确定性建模深度兼容,值得未来 1-2 年系统化研究。

  6. 拓扑特征的可解释性映射: 当一个 H_0 长寿命特征消失时,它背后的具体语义内容是什么?是策略在某种特定 prompt 上的回答模式发生了变化,还是某个 token 分布的偏移?把持续同调与注意力可视化、logit lens 等工具结合,建立"拓扑特征 → 语义内容"的映射表,是把我们的理论从"诊断器"升级为"诊断+解释器"的关键一步。这需要在大型 RLHF 训练中投入专门的标注资源,但回报是把 SRE 的告警从"出了什么问题"升级为"为什么出问题"。

参考文献

  1. Schulman J, Levine S, Moritz P, et al. Trust Region Policy Optimization. ICML 2015.
  2. Schulman J, Wolski F, Dhariwal P, et al. Proximal Policy Optimization Algorithms. arXiv:1707.06347, 2017.
  3. Christiano P, Leike J, Brown T, et al. Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
  4. Ouyang L, Wu J, Jiang X, et al. Training Language Models to Follow Instructions with Human Feedback. NeurIPS 2022.
  5. Bai Y, Kadavath S, Kundu S, et al. Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073, 2022.
  6. Leike J, Krueger D, Everitt T, et al. Scalable Agent Alignment via Reward Modeling. arXiv:1811.07871, 2018.
  7. Glaese A, McAleese N, Trebacz M, et al. Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2109.00912, 2021.
  8. Stiennon N, Ouyang L, Wu J, et al. Learning to Summarize from Human Feedback. NeurIPS 2020.
  9. Rafailov R, Sharma A, Mitchell E, et al. Direct Preference Optimization. NeurIPS 2023.
  10. Ethayarajh K, Xu W, Jurafsky D, et al. KTO: Model Alignment as Prospect Theoretic Optimization. arXiv:2402.01306, 2024.
  11. Edelsbrunner H, Harer J. Computational Topology: An Introduction. AMS, 2010.
  12. Carlsson G. Topology and Data. Bulletin of the AMS, 2009.
  13. Otter N, Porter M, Tillmann U, et al. A Roadmap for the Computation of Persistent Homology. EPJ Data Science, 2017.
  14. Fasy B, Kim J, Lecci F, et al. Introduction to the TDA Package. Journal of Statistical Software, 2021.
  15. Gao L, Schulman J, Hilton J. Scaling Laws for Reward Model Overoptimization. ICML 2023.

一句话摘要: 把 RLHF 后训练动力学放到策略流形的拓扑-几何视角下重写,持续同调的 Betti 数曲线和拓扑熵能比奖励曲线本身更早 200-500 步识别奖励黑客;联合 H_{topo} 反弹率、奖励-拓扑相关性、Betti 数脉冲三判据构成一套工业级可观测性指标体系,让 SRE 在训练崩塌前自动回滚到稳定的 checkpoint。

相关文章

  • 偏好优化算法的几何统一理论 20268月19日
  • 大模型训练动力学的李雅普诺夫稳定性理论 20268月18日
  • 大模型 Scaling Law 的临界相变理论 20268月17日

评论

加载评论中…

发表评论

返回文章列表