当前标签:大模型研究 · 共 55 篇
本文用统计场论重新推导课程学习,把课程温度 τ 与泛化误差的耦合刻画为亚临界-临界-超临界三段式相变,给出临界温度 τc 的封闭形式、盆地连通性的相变诊断,以及 SRE 训练平台可观测性的三组新指标。
本文建立推测解码的接受率统计力学框架,揭示单次推测窗口的接受数方差与 Rényi 散度的有限样本相变性质,证明最优猜测长度 κ* 在 α ∈ [0.68, 0.75] 的实际工作区间内自然收敛到 [3,7],并论证 α_c ≈ 0.74 作为工程相变点的双曲鞍点本质。
本文从连续线性 ODE 出发,重建 SSM 的离散对偶形式,证明 Mamba 选择性扫描与 S4 对偶卷积核在频域共享同一谱族,并由此推出 Mamba-2 SSD 对偶的线性注意力等价与受限傅里叶基的秩-1 闭式。
把优化器重新理解为带温度场的动态系统是 2026 年大模型训练理论的最大范式转移。本文以 Langevin 动力学、Fokker-Planck 方程与辛几何三条数学线索,重新审视 SGD、Shampoo、Muon、SOAP 的统一图景,揭示隐式正则化作为大模型泛化的真正设计自由度——并指出 K-FAC、Shampoo、Muon 等二阶方法的本质是把损失景观各向异性转化为更新方向协方差矩阵的单位化。
用微分拓扑与持续同调重新解读 LLM 损失景观:模式连接性、MoE 置换对称性、持续预训练的盆地相变与后训练稀疏奖励的高原-峡谷结构,给出 2026 年合并与后训练的工程决策框架。
本文从 cross-entropy 几何结构出发,给出注意力 $W_V$ 矩阵低秩吸引子定理,证明有效秩上界为 $mathrm{rank}(V^*)$。结合 Adam 隐式秩正则化、softmax 谱压缩、扩散 / DPO 等不同训练目标的秩变化,统合理解 2026 年所有主流注意力变体、KV cache 压缩算法与 LoRA rank 选择的理论基础。
从 Multi-Head 到 Multi-Latent,分组查询注意力走过了从“等价压缩”到“几何重构”的四阶段演化;本文用信息几何与秩分析重新审视 GQA、MLA 与 Q/K 解耦的极限,并给出 2026 H2 注意力架构选型的理论判据。
把涌现能力、grokking、长度泛化统一为同一族几何相变;用统计场论与微分几何重建能力流形;给出 4 个可证伪预言与 GP-Bench 协议。
用信息论重建 test-time scaling:熵坍缩定理 + 互信息瓶颈 + ToT Pareto 前沿三个核心定理,加上 Mermaid 调度流程图与 2026 H2 趋势猜想,给出 verifier 驱动的统一决策框架。
当文本生成从打字机式自回归转向块级并行去噪,推理时计算的帕累托前沿正在被改写。本文从 Markov 链基础出发,重建 LLaDA 8B、Gemini Diffusion、Mercury Coder 与 DiffusionGemma 的统一理论框架,解释为什么 dLLM 不仅带来 5-10 倍吞吐量,还重新分配了推理时 compute 的最优预算。
从 Fourier 基的频带截断,到 ALiBi 的线性偏置假设,再到 YaRN 的双阶段插值与频谱保持,位置编码的演化本质上是一场关于“Transformer 能否在训练窗口外做频率泛化”的理论辩论。本文从 loss landscape 的频域耦合角度重建这一辩论的理论框架,并给出 2026 年的工业级决策依据。
当一个社区在 12 个月内合并出 200+ 个 SOTA 模型时,模型合并已经从工程技巧升格为可被严格分析的理论对象。本文从权重空间几何、Taylor 低阶截断、interference 算法分解与进化搜索四个层次,为 2026 年的模型合并画一张算法几何地图。
2024-2026 年 mech interp 从手工作坊走向半自动化 + 理论化双轨:稀疏自编码器在 Claude 3 Sonnet 上识别 3400 万个单义特征,ACDC 算法在 4 GPU 小时内自动重建 IOI 电路,因果中介分析把 head 级 indirect effect 形式化。MoE / Mamba-3 / CoT 推理的可解释性扩展也已起步,但 TC0 理论边界意味着纯 attention 电路无法完备解释推理时计算。
当多个微调后的 LLM 都站在损失景观的低谷平原上时,模型合并的成败取决于它们是否处于同一个线性模式连通盆地。本文从线性模式连通性出发,拆解 Task Arithmetic、TIES-MERGING 与 DARE 三大合并范式的数学假设、归并冲突与冗余处理。
2026 年大模型研究的最深刻转向不是更大的模型,而是更聪明的“挑数据的策略”。本文从 influence functions 的早期理论出发,沿着 data curation scaling laws、selection-via-loss、qualitative diversity 三条路径,重建 2026 年大模型数据选择理论的全貌,论证“数据缩放律”正在替代“参数缩放律”成为预训练效率的新瓶颈。
用统计力学和随机矩阵理论重新审视 model collapse:本文给出 2026 年关于递归合成数据训练的可量化边界,给出 n_c、rho、sigma_min* 三个可测量量。
从 Chomsky 的系统性原则出发,结合 SCAN、COGS 等结构化基准的近期实证,重新审视 Transformer 是否真正具备结构性归纳偏置,并提出面向组合泛化的架构诊断框架。
本文重新审视 Grokking 现象在大模型训练语境下的理论意涵——损失函数在长时间饱和之后突然出现的泛化跃迁,并非“训练巧合”,而是损失景观中高维相变的宏观投影。理解这一相变结构,将重塑我们对涌现能力、缩放定律与训练策略的工程直觉。
当显式 CoT 撞上 token 化的表达瓶颈,潜空间连续推理正成为 2026 年推理理论的新前沿。本文以 Coconut (ICLR 2025) 与 CODI (2026-01) 为轴,剖析连续思维链如何通过 hidden state 传递替代 token 生成,揭示其在隐空间几何、训练动力学、可解释性三个层面的理论重塑,并给出离散 vs 连续 CoT 的工程选型决策树。
当 LLM 训练规模突破万亿 token,AdamW 不再是默认答案——本文从损失景观几何学出发,分析 Lion-2、Muon、Soap、Shampoo 四大优化器家族在 2026 年 LLM 训练中如何超越 AdamW,节省 10-35% 训练 token。