合成数据训练与坍缩的信息几何理论 2026
从 Fisher 信息矩阵的退化轨迹出发,把 model collapse 重新理解为生成模型与真实分布之间 KL 散度沿 Fisher-Rao 测地线的相变;给出合成数据 scaling 的临界点公式、三阶段相变判据与工程上的早停、抗 collapse 设计清单。
- #大模型研究
Archive
97 篇文章
切换标签
从 Fisher 信息矩阵的退化轨迹出发,把 model collapse 重新理解为生成模型与真实分布之间 KL 散度沿 Fisher-Rao 测地线的相变;给出合成数据 scaling 的临界点公式、三阶段相变判据与工程上的早停、抗 collapse 设计清单。
把稀疏自编码器与电路发现统一为残差流激活的稀疏因果分解,几何-信息论-因果三件套训练目标使 SAE 特征成为可干预、可审计、可蒸馏的电路原子,在 7B-13B 模型上已具备工程化训练与红队探针的落地条件。
把知识蒸馏的传输通道从概率单纯形升级为 Grassmann 流形,把暗知识从 Hinton 软标签的标量统计扩展到特征子空间的正交基,把学生模仿教师重构为流形间的测地线对齐——为下一代多模态/异构蒸馏提供理论底座。
把对齐训练中保留预训练知识与习得新偏好的张力,形式化为策略流形上的保留-习得比;证明 GRPO 的 KL 锚点是这条张力 Pareto 前沿的几何稳定锚点。
从偏序集与 Galois 连接出发,把 CoT 推理状态形式化为格、把压缩映射形式化为抽象算子、把抽象层级形式化为格同态与范畴函子,给出 CoT 蒸馏的商格条件与压缩-正确率下界,并落到 5 类可测格不变量。
把神经坍缩视为权重空间的 blow-up 奇点,给出三类代数不变量(截面秩亏、Schubert 类积分、Chern 类积分),让训练监控从单一损失曲线升级为实时的几何相位图。
把大模型学习重写为输入-上下文-提示三层互信息的非单调耦合优化,用 InfoNCE 下界作为可观测代理、用算法信息论结构函数作为形态度量,让 IB 成为几何拓扑动力系统公理化四条主线的垂直度量层。
把大模型在 prompt 中的少样本学习统一重写为隐式贝叶斯后验推断 + 隐式梯度下降的双重解释,在 PAC-Bayes 边界与算法信息论的复合约束下给出可计算的泛化误差上界,让 ICL 的可泛化能力从经验直觉变成可证伪、可工程优化的理论对象。
从单特征稀疏激活到特征电路的二阶统计与高阶累积量——把 LLM 可解释性从一阶语义推进到算法子结构,给出 SAE 训练的 Pareto 改进、电路冗余度猜想与拓扑骨架幂律。
从自然梯度、TRPO、PPO 到 Wasserstein 梯度流,把 RLHF/RLVR 时代的策略优化统一为策略分布空间上的黎曼优化,并给出六个基于几何意义的训练稳定性推论。
把 SSM / linear attention / Mamba / RetNet / RWKV 全部纳入 (A,B,C,D) 对偶线性算子的统一骨架,用 State Space Duality 给出与 softmax attention 的等价类,在 input-dependent 选择性遗忘机制下推到 LTV 系统,并论证 2026 年主流 LLM 架构收敛到 SSM + sparse attention 混合范式的工程必然性。
以 statistical decision theory 为统一框架,把 2024-2025 年兴起的 test-time compute scaling 四大主流范式 (CoT / ToT / PRM / verifier-search) 放进同一张 compute-optimal allocation frontier 图,论证「用算力换推理」是大模型继 pretraining scaling 之后的第二条扩展曲线,其增长边界由 verifier 质量决定而非 base model 容量。
把自回归与扩散看作同一状态空间上的 Forward-Backward 对偶,通过对接面映射器、混合误差界与破缺检测,把等价性层面提升到对偶结构层面,为 2026 年混合调度器奠基。
把扩散过程的连续时间演化与离散 token 的 mask-and-replace 机制统一为同一个生成模型族,自回归只是 mask diffusion 在特定归纳偏置下的边界情形;采样步数与生成质量遵循幂律,工程上 confidence-based 调度 + 混合 AR/diffusion 部署是 2026 年的最优策略。
把连续时间扩散过程与离散 token 自回归统一在随机微分方程的同一形式下,把掩码扩散的去噪过程解释为吸收布朗运动的离散化采样,推导出 LLaDA 类模型生成质量与采样步数之间的幂律标度,并讨论对训练目标、长度泛化和推理加速的工程推论。
把稀疏 MoE 的专家共激活矩阵编码为 Vietoris-Rips 单纯复形,用持续同调 (persistent homology) 提取 Betti 数与持续图,刻画 β₀ 专家社群、β₁ 循环协同、β₂ 高阶空腔的涌现过程,给出比负载均衡 loss 更早的训练健康度信号与 checkpoint 选择准则。
把彩票假设从十亿参数尺度的存续性、隐式电路的自发涌现、以及训练动力学的相位结构,统一在稀疏相位恢复与统计力学组合优化的视角下,并给出稀疏预训练加早停的工程协议。
把 RLHF 训练动力学放到策略流形的拓扑-几何视角下重写,持续同调能比奖励曲线本身更早识别奖励黑客,联合拓扑熵、奖励-拓扑相关性、Betti 数脉冲三判据构成工业级可观测性指标体系。
把 RLHF 之后的偏好优化算法家族——DPO、IPO、KTO、ORPO、SimPO、GRPO、RLVR——放到同一个损失景观里去看,会发现它们本质上是同一个 Bradley-Terry 对偶目标在参考策略附近的不同切平面投影。本文给出统一形式化与工程决策准则。
把大模型训练动力学重新表述为损失景观上梯度流的李雅普诺夫稳定性,能把收敛这一工程口号变成可被理论验证的命题,并给出对训练监控可直接落地的工程推论。