潜空间推理的几何学 2026:从 Coconut 到 CODI 的连续思维链如何重塑推理理论
当显式 CoT 撞上 token 化的表达瓶颈,潜空间连续推理正成为 2026 年推理理论的新前沿。本文以 Coconut (ICLR 2025) 与 CODI (2026-01) 为轴,剖析连续思维链如何通过 hidden state 传递替代 token 生成,揭示其在隐空间几何、训练动力学、可解释性三个层面的理论重塑,并给出离散 vs 连续 CoT 的工程选型决策树。
- #大模型研究
Archive
97 篇文章
切换标签
当显式 CoT 撞上 token 化的表达瓶颈,潜空间连续推理正成为 2026 年推理理论的新前沿。本文以 Coconut (ICLR 2025) 与 CODI (2026-01) 为轴,剖析连续思维链如何通过 hidden state 传递替代 token 生成,揭示其在隐空间几何、训练动力学、可解释性三个层面的理论重塑,并给出离散 vs 连续 CoT 的工程选型决策树。
当 LLM 训练规模突破万亿 token,AdamW 不再是默认答案——本文从损失景观几何学出发,分析 Lion-2、Muon、Soap、Shampoo 四大优化器家族在 2026 年 LLM 训练中如何超越 AdamW,节省 10-35% 训练 token。
从 $O(n^2)$ 全注意力的算法下界出发,分析 DeepSeek NSA 的“压缩-选择-滑动”三阶段架构为何能达到 $O(n log n)$ 复杂度和接近全注意力的检索精度,梳理 2026 年稀疏注意力四大方案的版图与三个未解的开放问题。