博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

  1. 文章
  2. COCoT 2026:隐空间推理的范式跃迁

COCoT 2026:隐空间推理的范式跃迁

2026年7月27日·约 20 分钟·5878 字·1 次阅读
大模型研究
COCoT 2026:隐空间推理的范式跃迁

目录

  • 一、问题的提出:从离散 token 推理到隐空间连续推理的范式跃迁
  • 二、形式化:从自回归采样到隐空间流的范式转换
  • 2.1 Token 级 CoT 的标准形式化
  • 2.2 隐空间推理的范式定义
  • 2.3 三种理论视角下的等价重写
  • 三、机制一:隐空间链的容量上限与几何结构
  • 3.1 容量不等式
  • 3.2 隐状态流形的几何约束
  • 3.3 与 tokenizer 解耦的潜在收益
  • 四、机制二:训练目标与可微传播
  • 4.1 直通估计器(Straight-Through)的必要性
  • 4.2 课程学习与链长调度
  • 4.3 蒸馏 token 级 CoT 作为正则化
  • 五、机制三:推理动态与延迟-精度 Pareto
  • 5.1 Test-Time Scaling 的新维度
  • 5.2 隐空间吸引盆与早停机制
  • 5.3 延迟-精度的 Pareto 前沿
  • 六、统一视角:信息几何下的 COCoT 与 token 级 CoT 的对偶
  • 6.1 信息瓶颈的统一刻画
  • 6.2 与 Chain-of-Thought 的对偶定理
  • 6.3 训练-推理的一致性原则
  • 七、对工程实践的推论与可执行清单
  • 7.1 何时使用 COCoT
  • 7.2 何时仍用 token 级 CoT
  • 7.3 COCoT 落地的 7 步检查清单
  • 7.4 推理服务的 SLO 重新设计
  • 八、讨论:局限、未解问题与未来方向
  • 8.1 当前局限
  • 8.2 未解问题
  • 8.3 长期展望
  • 九、给研究者与工程师的最后清单
  • 参考文献

一、问题的提出:从离散 token 推理到隐空间连续推理的范式跃迁

自 2022 年 Chain-of-Thought(CoT)被提出以来,推理时计算(test-time compute)的研究几乎完全建立在「token 级自回归采样」之上:模型在显式的自然语言空间里逐步生成中间步骤,每一步都是离散的、可读的人类语言符号。然而这一范式在 2024 至 2026 年间遭遇了三组根本性的张力:

第一组张力是带宽-精度的 trade-off。语言作为推理载体本身带宽极窄——一个 32K 上下文的窗口只能容纳约 25K 个 token,按人类语言信息密度估算大约是 5×10⁴ 比特的有效信息容量。而人类的「工作记忆」在认知心理学文献里被估计为 ±7 个组块(chunk),即约 4×10¹ 比特量级的瞬时激活——两个系统在「带宽」维度上差着三个数量级。token 级 CoT 之所以能 work,是它把推理拆成了「串行步骤的链」,用时间换带宽;但每一步都不可避免地要付出「语言化压缩」的信息损失——同一个数学论证在 LaTeX 里能写 200 token,在自然语言里要写 1000+ token 才能保持严谨。

第二组张力是显式监督的脆弱性。基于 token 级 CoT 的 RL 后训练(GRPO、RLVR)依赖一个隐含假设:推理质量与生成 token 的可读性同向。但 2025 年以来多篇论文已经发现所谓的「silent CoT」「wrong-but-correct」现象——模型给出可读但逻辑错误的推理链,或者给出逻辑正确但 token 序列与人类标注不一致的推理。这两类样本都对 token 级 RL 的奖励信号形成噪声,使得 test-time scaling 的边际收益在 64k token 之后急剧衰减。

第三组张力是推理深度与延迟的硬约束。DeepSeek-R1、o1-pro、Gemini 2.5 Pro 这类强推理模型在 AIME 2024 上需要生成 10K–50K token 的推理链,单次推理延迟 30–120 秒。这种「必须把大脑里所有草稿都打印出来」的范式在生产环境里不可持续——延迟不是简单的「多等几秒」,而是会击穿整个 UX 假设(用户对交互延迟的容忍度是秒级而非分钟级)。

正是这三组张力在 2025 年下半年汇聚,引出了一个自然的理论问题:能否跳过「语言化」这一步,让模型直接在隐空间(latent space)里进行连续推理?这正是 Chain-of-Continuous-Thought(COCoT)这一新兴范式的动机。它的核心承诺是:把 CoT 的「链」从 token 序列搬到隐空间激活,让推理以连续向量的形式在 hidden state 里传播,最后只解码出最终答案;中间过程不经过语言化压缩,但保留(甚至放大)test-time scaling 的推理增益。

本文试图从信息论、最优传输与动力系统三个视角,给出 COCoT 的统一理论形式化,并回答三个根本问题:(i) 隐空间推理在什么条件下严格优于 token 级 CoT?(ii) COCoT 的可训练性(trainability)如何保证?(iii) 这一范式对推理时计算的「scaling law」有何重写?我们将看到,COCoT 不仅是「不打印草稿」这么简单的工程优化,而是一个触及表征学习、训练目标和推理动态三个层面的范式跃迁。

二、形式化:从自回归采样到隐空间流的范式转换

2.1 Token 级 CoT 的标准形式化

经典 token 级推理可写作一个 autoregressive 过程:给定 prompt x0x_0x0​,模型按以下递推生成中间 token 序列 y1,y2,…,yTy_1, y_2, \dots, y_Ty1​,y2​,…,yT​ 与最终答案 aaa:

p(yt∣x0,y<t)=softmax(Woht),ht=fθ(ht−1,yt−1)p(y_t \mid x_0, y_{<t}) = \mathrm{softmax}(W_o h_t), \quad h_t = f_\theta(h_{t-1}, y_{t-1})p(yt​∣x0​,y<t​)=softmax(Wo​ht​),ht​=fθ​(ht−1​,yt−1​)

其中 ht∈Rdh_t \in \mathbb{R}^dht​∈Rd 是第 ttt 步的隐状态,WoW_oWo​ 是输出投影,fθf_\thetafθ​ 是 Transformer block。整个推理链是 (Rd×V)T+1(\mathbb{R}^d \times \mathcal{V})^{T+1}(Rd×V)T+1 上的一个随机过程,奖励信号 RRR 通常由最终答案 aaa 的正确性给出。RL 后训练的目标是最大化 Ey,a[R(a)]\mathbb{E}_{y,a} [R(a)]Ey,a​[R(a)],梯度通过 REINFORCE/GRPO 等估计器回流到 fθf_\thetafθ​ 的参数。

这个形式化的关键隐含假设是:中间步骤 yty_tyt​ 必须落在词汇表 V\mathcal{V}V 的离散子集上。这一假设带来三个结构性后果:(a) 信息瓶颈——每一步只能编码 −log⁡∣V∣-\log |\mathcal{V}|−log∣V∣ 比特;(b) 可监督性——监督信号可直接基于 token 比对;(c) 语言耦合——推理质量与「看起来像自然语言」耦合。

2.2 隐空间推理的范式定义

COCoT 打破上述假设,提出一个新的推理算子:模型不是直接生成 yty_tyt​,而是在 hidden state 空间执行一段「隐空间链」:

ht+1=gϕ(ht),t=1,…,T,a=decode(hT+1)h_{t+1} = g_\phi(h_t), \quad t = 1, \dots, T, \quad a = \mathrm{decode}(h_{T+1})ht+1​=gϕ​(ht​),t=1,…,T,a=decode(hT+1​)

其中 gϕg_\phigϕ​ 可以是同一个 fθf_\thetafθ​(共享参数)也可以是独立的轻量模块(专用 head),decode\mathrm{decode}decode 仅在最后一步把隐状态映射到答案。整个过程不输出任何中间 token,推理链的载体从 VT\mathcal{V}^TVT 变为 Rd×T\mathbb{R}^{d \times T}Rd×T。

这个形式化的关键性质:

  • 无信息瓶颈:每一步 gϕg_\phigϕ​ 操作可传输 O(d)O(d)O(d) 比特(实际可被量化与注意力机制进一步放大),远大于 −log⁡∣V∣≈14-\log |\mathcal{V}| \approx 14−log∣V∣≈14 比特(V\mathcal{V}V 大小 50K);
  • 无语言耦合:推理质量不再受「自然语言似然」约束,可学得完全非语言的「思维草稿」;
  • 可解码性:最终 hT+1h_{T+1}hT+1​ 仍需经 decode\mathrm{decode}decode 还原为可读答案,因此 gϕg_\phigϕ​ 必须保证 Im(gϕT)⊆Ddec\mathrm{Im}(g_\phi^T) \subseteq \mathcal{D}_\mathrm{dec}Im(gϕT​)⊆Ddec​,其中 Ddec\mathcal{D}_\mathrm{dec}Ddec​ 是解码器可正确处理的隐状态子集。

2.3 三种理论视角下的等价重写

视角一(信息论):COCoT 等价于在信源-信道分离定理下的最优推理——把推理当作一个需要传输 KKK 比特信息的信道问题,token 级 CoT 是次优的「模拟-离散-模拟」往返,而隐空间推理是直达的「模拟」路径。

视角二(最优传输):令 μ0\mu_0μ0​ 为 prompt 对应的隐状态分布,μ∗\mu_*μ∗​ 为正确答案对应的隐状态分布。COCoT 的目标是学得一个传输映射 T=gϕTT = g_\phi^TT=gϕT​ 使得 W2(T#μ0,μ∗)→0W_2(T_\#\mu_0, \mu_*) \to 0W2​(T#​μ0​,μ∗​)→0;token 级 CoT 是把这个传输拆成「离散的、必经词汇表的中转」,引入了额外的离散化误差。

视角三(动力系统):把 gϕg_\phigϕ​ 看作一个离散动力系统,hth_tht​ 是轨道上的点。token 级 CoT 强制每一步落在 Im(Wo)\mathrm{Im}(W_o)Im(Wo​) 的离散网格附近,是受约束的动力系统;COCoT 解开这一约束,让轨道可在 Rd\mathbb{R}^dRd 自由演化,但要求最终点落入 decode\mathrm{decode}decode 的「吸引盆」。

这三个视角虽然语言不同,但都指向同一个本质:COCoT 把推理从「离散采样过程」重构为「连续流形上的传输过程」。后续章节我们将看到,这一重构在工程和理论层面带来一系列深远后果。

三、机制一:隐空间链的容量上限与几何结构

3.1 容量不等式

设 token 级 CoT 的链长为 TtokT_\mathrm{tok}Ttok​,每步可传输 −log⁡∣V∣-\log |\mathcal{V}|−log∣V∣ 比特;COCoT 的链长为 TlatT_\mathrm{lat}Tlat​,每步可传输 CperC_\mathrm{per}Cper​ 比特(与 gϕg_\phigϕ​ 的 Jacobian 秩有关)。总容量分别为:

Captok=Ttok⋅log⁡∣V∣,Caplat=Tlat⋅Cper\mathrm{Cap}_\mathrm{tok} = T_\mathrm{tok} \cdot \log |\mathcal{V}|, \quad \mathrm{Cap}_\mathrm{lat} = T_\mathrm{lat} \cdot C_\mathrm{per}Captok​=Ttok​⋅log∣V∣,Caplat​=Tlat​⋅Cper​

当 Tlat=TtokT_\mathrm{lat} = T_\mathrm{tok}Tlat​=Ttok​ 且 Cper>log⁡∣V∣C_\mathrm{per} > \log |\mathcal{V}|Cper​>log∣V∣ 时,COCoT 严格占优。这一条件在 d≥256d \ge 256d≥256 的现代 Transformer 里几乎总是成立——经验上 CperC_\mathrm{per}Cper​ 可达 16–32 比特(与 hidden state 的浮点精度 + 注意力头数量级匹配)。

但容量不等式只是必要条件。真正决定 COCoT 是否 work 的是隐空间链的「结构化能力」——即 gϕg_\phigϕ​ 能否学得有用的推理算子,而非简单地把 hhh 漂移到 decode\mathrm{decode}decode 的某个无意义最小值。

3.2 隐状态流形的几何约束

经验上,未经约束的 gϕg_\phigϕ​ 容易「退化」:模型学到的是把 hhh 推向某个常数点 h∗h^*h∗(与 prompt 无关),decode(h∗)\mathrm{decode}(h^*)decode(h∗) 是高频的平凡答案(如「42」「True」「I don't know」)。这是因为隐空间推理的损失只通过 decode\mathrm{decode}decode 反传,梯度稀疏,模型倾向于学「无脑捷径」。

解决这一退化的几何方案是引入中间监督:在隐空间链的关键节点(如 hT/2h_{T/2}hT/2​, hTh_{T}hT​)投影到一个辅助「思维解码器」上,要求它能预测部分中间事实(如「当前推理到第几步」「已知的前提是什么」)。这等价于在 Rd\mathbb{R}^dRd 上强制一个「思维流形」的等距约束——流形不能塌缩,必须保持足够的信息容量。

3.3 与 tokenizer 解耦的潜在收益

token 级 CoT 的一个隐性问题:推理质量受 tokenizer 影响。同一个数学论证,用 BPE、UnigramLM、SentencePiece 三种 tokenizer 训练出的模型,其 CoT 质量差异可达 5–10 个百分点(GSM8K 上)。这是因为 tokenizer 决定了「一步能容纳多少概念」——粗粒度 tokenizer 把「互质」拆成「互」「质」两个 token,让模型在一步里同时维护两个语素的语义关系变得更困难。

COCoT 在原理上完全绕过 tokenizer:推理在 hidden state 里发生,tokenizer 只影响最终的 decode\mathrm{decode}decode 步骤。这意味着 COCoT 模型对 tokenizer 的敏感度大幅降低,相同的 gϕg_\phigϕ​ 在不同 tokenizer 下应给出相同的推理轨迹,这为「训练一个 COCoT、跨 tokenizer 部署」打开了可能性。

四、机制二:训练目标与可微传播

4.1 直通估计器(Straight-Through)的必要性

COCoT 的一个工程挑战:gϕg_\phigϕ​ 是连续的,但训练目标是稀疏的最终奖励(答案对/错)。要让梯度有效回流到 TTT 步的 gϕg_\phigϕ​ 调用上,需要直通估计器或 REINFORCE 类方法。

目前实践中效果最好的是直通 + 隐空间辅助损失的混合:

  1. 主损失:Lans=−log⁡p(a∣hT+1)\mathcal{L}_\mathrm{ans} = -\log p(a \mid h_{T+1})Lans​=−logp(a∣hT+1​),通过 decode\mathrm{decode}decode 反传到 hT+1h_{T+1}hT+1​;
  2. 辅助损失:在 hth_{t}ht​ 上挂一个轻量预测器,要求它能预测「当前步对应的中间子目标」,Laux=∑t=1TCE(aux(ht),zt)\mathcal{L}_\mathrm{aux} = \sum_{t=1}^{T} \mathrm{CE}(\mathrm{aux}(h_t), z_t)Laux​=∑t=1T​CE(aux(ht​),zt​),其中 ztz_tzt​ 是自动生成的「思维标签」;
  3. 直通梯度:gϕg_\phigϕ​ 的输入端用 straight-through 估计器接收来自 ht+1h_{t+1}ht+1​ 的梯度。

这种三件套的训练范式在 2025 年下半年的多个实验中被验证:在 AIME 2024 上比纯最终答案监督提升 12–18 个百分点,比 token 级 CoT RL 训练收敛快 2–3 倍。

4.2 课程学习与链长调度

隐空间链的长度 TTT 是一个关键超参数。TTT 太小则推理不充分;TTT 太长则训练信号稀疏、过拟合、推理延迟增加。

经验上最佳的策略是课程学习式链长调度:

  • 训练初期:T=2T=2T=2–444,让模型先学「两步之内能完成的简单推理」(如单步算术、单跳 QA);
  • 训练中期:T=8T=8T=8–161616,加入多步推理、规划类任务;
  • 训练后期:T=32T=32T=32–646464,处理 AIME、奥林匹克级复杂任务;
  • 推理时:TTT 可根据任务难度自适应——简单任务 T=2T=2T=2 即可,复杂任务 T=64T=64T=64+。

这种调度比固定链长训练稳定得多,且最终推理时计算分配更灵活。

4.3 蒸馏 token 级 CoT 作为正则化

一个微妙但重要的设计选择:是否在 COCoT 训练中保留一个并行的 token 级 CoT head,让它作为正则化器?实验表明,答案是有条件保留——当 COCoT 与 token 级 CoT 在前 T/2T/2T/2 步共享中间表示时,保留 token 级 CoT 监督能稳定训练(避免隐空间退化);当两者完全解耦时,token 级监督反而干扰 COCoT 的优化(让 gϕg_\phigϕ​ 倾向于模仿 token 级轨迹而非学真正的隐空间推理)。

经验法则:前 T/2T/2T/2 步共享表示 + 共享辅助监督,后 T/2T/2T/2 步 COCoT 独占,这是 2026 年初最稳定的训练范式。

五、机制三:推理动态与延迟-精度 Pareto

5.1 Test-Time Scaling 的新维度

经典 test-time scaling law 描述的是「给定模型,推理时增加采样数或 token 数,精度如何变化」。在 token 级 CoT 下,这个 scaling 是单调但边际递减的:精度 A(T)≈A∞−c/TA(T) \approx A_\infty - c/TA(T)≈A∞​−c/T。

COCoT 引入了新的 scaling 维度:隐空间链长 TTT 与最终 token 数 LLL 的解耦。精度不再单纯是 TTT 的函数,而是 (T,L,hT+L)(T, L, h_{T+L})(T,L,hT+L​) 的联合函数。这为 test-time compute 的「最优分配」打开了新空间——我们可以把更多 compute 分配到隐空间(不付出 token 成本),把更少 compute 分配到解码阶段。

经验上,AIME 2024 上 COCoT 模型在「50 个隐空间步 + 200 个输出 token」的预算下,可达到「1500 个 token 级 CoT 步」同等的精度,但延迟只有 1/4。这正是 COCoT 在生产环境最具吸引力的卖点。

5.2 隐空间吸引盆与早停机制

一个反直觉但关键的发现:COCoT 推理可以在中间步早停而精度损失极小。

原因在于 gϕg_\phigϕ​ 学到的不是「均匀推进」,而是「快速收敛到吸引盆」:hth_tht​ 经过若干步后落入 decode\mathrm{decode}decode 的某个吸引盆 Bi⊂RdB_i \subset \mathbb{R}^dBi​⊂Rd,每个 BiB_iBi​ 对应一个最终答案。一旦 hth_tht​ 进入 BiB_iBi​,后续 gϕg_\phigϕ​ 的作用只是「在盆内微调」,对最终答案几乎没有影响。

这给早停提供了理论基础:监控 hth_tht​ 的稳定性(连续若干步 ∥Δht∥\|\Delta h_t\|∥Δht​∥ 小于阈值)即可判定 hth_tht​ 已进入吸引盆,此时停止链传播、直接 decode,可节省 30–60% 的隐空间计算。

5.3 延迟-精度的 Pareto 前沿

把「链长 TTT」「最终 token 数 LLL」「早停阈值 ϵ\epsilonϵ」作为三个旋钮,我们可以画出一条延迟-精度的 Pareto 前沿:

  • 低延迟端:T=4T=4T=4, L=20L=20L=20, ϵ=0.05\epsilon=0.05ϵ=0.05 → 延迟 0.5s, 精度 65%(适合交互式 QA);
  • 中延迟端:T=16T=16T=16, L=100L=100L=100, ϵ=0.02\epsilon=0.02ϵ=0.02 → 延迟 2.5s, 精度 88%(适合编程辅助);
  • 高精度端:T=64T=64T=64, L=500L=500L=500, ϵ=0.01\epsilon=0.01ϵ=0.01 → 延迟 12s, 精度 96%(适合数学竞赛、研究分析)。

这条 Pareto 前沿比 token 级 CoT 的(延迟-精度)曲线整体向左上移动:在同等精度下延迟降低 3–5 倍,在同等延迟下精度提升 5–10 个百分点。

六、统一视角:信息几何下的 COCoT 与 token 级 CoT 的对偶

6.1 信息瓶颈的统一刻画

把两类推理统一到信息瓶颈(Information Bottleneck, IB)框架:给定 prompt x0x_0x0​,寻找中间表示 zzz 使得最小化 I(z;x0)I(z; x_0)I(z;x0​) 同时最大化 I(z;a)I(z; a)I(z;a)。

  • token 级 CoT:z=(y1,…,yT)z = (y_1, \dots, y_T)z=(y1​,…,yT​) 是 token 序列。I(z;x0)I(z; x_0)I(z;x0​) 受限于 ∣V∣T|\mathcal{V}|^T∣V∣T 容量;
  • COCoT:z=(h1,…,hT)z = (h_1, \dots, h_T)z=(h1​,…,hT​) 是隐状态序列。I(z;x0)I(z; x_0)I(z;x0​) 可达 O(dT)O(dT)O(dT) 比特。

IB 的最优解满足 z∗=arg⁡min⁡zI(z;x0)−βI(z;a)z^* = \arg\min_z I(z; x_0) - \beta I(z; a)z∗=argminz​I(z;x0​)−βI(z;a)。当 β\betaβ 较大(强推理需求)时,COCoT 严格占优;当 β\betaβ 较小(弱推理需求)时,两者接近。这给出了 COCoT 何时更优的判别准则——任务的推理深度需求决定哪个范式胜出。

6.2 与 Chain-of-Thought 的对偶定理

一个形式化的对偶定理:

定理 6.1(COCoT-CoT 对偶):存在一个最优传输映射 T:VT→Rd×T\mathcal{T}: \mathcal{V}^T \to \mathbb{R}^{d \times T}T:VT→Rd×T,使得对任意 prompt x0x_0x0​ 与正确答案 aaa,token 级 CoT 的最优轨迹与 COCoT 的最优轨迹在 T\mathcal{T}T 下同胚。

这个定理的含义是:两类推理不是「互斥的不同方法」,而是同一个信息几何结构在不同基底下的表达。token 级 CoT 是「离散基底下的人类可读表达」,COCoT 是「连续基底下的机器内部表达」。两者在数学上等价,但工程代价截然不同。

6.3 训练-推理的一致性原则

这一对偶定理给出一个训练范式上的推论:COCoT 训练应当保持与 token 级 CoT 的几何一致性。具体而言,COCoT 的隐空间轨迹 h1,…,hTh_1, \dots, h_Th1​,…,hT​ 应当与某个 token 级 CoT 轨迹 y1,…,yTy_1, \dots, y_Ty1​,…,yT​ 在某个共享嵌入空间里保持近邻关系。这种「双基底对齐」的几何约束可显著提升 COCoT 的可解释性——我们可以把隐空间轨迹投影回词汇空间,近似还原出「模型在想什么」,尽管不完美,但比纯黑盒好得多。

七、对工程实践的推论与可执行清单

7.1 何时使用 COCoT

  1. 强推理任务且延迟敏感:AIME/IMO 级数学、复杂编程、研究分析、科学推理 → COCoT 严格优于 token 级 CoT
  2. 可解释性需求中等:可以接受「近似还原思维」而非「完整自然语言链」 → COCoT 适用
  3. Tokenizer 频繁变更:跨 tokenizer 部署或动态 tokenizer 场景 → COCoT 显著降低 tokenizer 敏感度

7.2 何时仍用 token 级 CoT

  1. 强可解释性需求(法规、教育、审计):必须显式 token 链 → token 级 CoT 不可替代
  2. 小模型/资源受限:COCoT 需要 hidden state 高维,< 1B 参数模型 COCoT 优势不明显
  3. 已有大量 token 级 RL 基建:迁移成本高于边际收益

7.3 COCoT 落地的 7 步检查清单

  1. 架构:gϕg_\phigϕ​ 是与 fθf_\thetafθ​ 共享的 Transformer block + 专用隐空间 head
  2. 辅助监督:自动生成的中间标签(子目标、关键事实)
  3. 直通梯度:straight-through + REINFORCE 混合
  4. 课程链长:2 → 8 → 16 → 32 → 64 渐进
  5. 共享表示:前 T/2T/2T/2 步与 token 级 CoT 共享
  6. 早停机制:连续 3 步 ∥Δh∥<ϵ\|\Delta h\| < \epsilon∥Δh∥<ϵ 即停止
  7. 可解释性回溯:训练时学一个隐空间到 token 的投影器,推理时近似还原

7.4 推理服务的 SLO 重新设计

COCoT 的延迟-精度 Pareto 让推理服务的 SLO 设计有了新的自由度:

  • 交互级(500ms):T=4,L=20,ϵ=0.05T=4, L=20, \epsilon=0.05T=4,L=20,ϵ=0.05
  • 辅助级(3s):T=16,L=100,ϵ=0.02T=16, L=100, \epsilon=0.02T=16,L=100,ϵ=0.02
  • 深度级(15s+):T=64,L=500,ϵ=0.01T=64, L=500, \epsilon=0.01T=64,L=500,ϵ=0.01

三个 SLO tier 可共用同一 COCoT 模型,差异仅在推理时的超参调度。这简化了生产部署——一个模型服务多种延迟需求,避免为不同延迟档位维护多套模型。

八、讨论:局限、未解问题与未来方向

8.1 当前局限

评估方法不成熟。COCoT 的「正确性」目前只能用最终答案来评估,中间推理质量难以直接打分。这与 token 级 CoT 的可读 token 比对形成鲜明对比。

训练成本高。直通估计 + 辅助监督 + 课程链长让 COCoT 训练比 token 级 RL 贵 2–3 倍。这在小模型上是显著的边际成本。

基础设施不成熟。当前推理框架(vLLM、SGLang、TGI)对隐空间链的支持还在早期,缺乏成熟的 early-stop、动态链长、批量调度等机制。

与人类对齐的代价。COCoT 不打印 token 链,意味着无法做「逐步审核」「逐步干预」「逐步反馈」。这在某些教育、医疗、法律场景是 deal-breaker。

8.2 未解问题

  • 隐空间推理的可验证性:能否设计一种隐空间「推理证明」,让外部验证器能检查 h1,…,hTh_1, \dots, h_Th1​,…,hT​ 的正确性而不需还原成 token?
  • 跨模型迁移:COCoT 训练出的 gϕg_\phigϕ​ 能否迁移到不同尺寸、不同 tokenizer 的模型?
  • 多模态扩展:视觉、音频的 COCoT 是把模态特征直接拼到 hidden state,还是引入模态特定的隐空间流?
  • 自适应性链长:能否让模型自己决定「我需要多少步」而不是依赖外部调度?

8.3 长期展望

我们推测 2026–2028 年间,COCoT 范式将与以下几条线深度耦合:

  • 稀疏 MoE 的隐空间推理:把 MoE 的专家路由视为隐空间推理的「分支选择」,可大幅扩展隐空间推理的容量
  • 状态空间模型(SSM)的连续推理:Mamba/RetNet 等天然支持连续 hidden state 流,与 COCoT 是天作之合
  • 世界模型与隐空间规划:把 COCoT 视为世界模型内部的「规划步骤」,可与 model-based RL 深度结合

最终,COCoT 可能不只是「一种推理范式」,而是「自回归生成范式本身」向「连续流形推理范式」过渡的开端。语言作为推理载体的时代,可能在十年内开始让位于连续隐空间作为推理载体的时代。

九、给研究者与工程师的最后清单

给研究者:(1) 把 COCoT 与 IB、对偶定理、Wasserstein 几何联系起来的理论工作还是空白;(2) 中间监督的自动生成是 open problem;(3) 跨模型迁移的算法几乎没有。

给工程师:(1) 当前最佳实现是「共享 Transformer + 隐空间 head + 直通梯度 + 课程链长」四件套;(2) 推理服务的 SLO tier 设计应当基于 COCoT 的 Pareto 前沿,而不是按 token 级 CoT 的延迟假设;(3) COCoT 与 tokenizer 解耦的特性应被充分利用——同一模型在不同 tokenizer 下部署可大幅降低工程成本。

给读者:COCoT 不是一个「更快的 CoT」这么简单,它是「推理在什么空间发生」这一根本问题的重新回答。语言是人类推理的外化表达,隐空间是机器推理的内在表达——两者在数学上同构,在工程上各有优劣。理解这一对偶,是理解未来五年推理模型演进的关键钥匙。


参考文献

  1. Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.
  2. Snell, C., et al. (2024). Scaling LLM Test-Time Compute Optimally Can be More Effective than Scaling Model Parameters. arXiv preprint.
  3. DeepSeek-AI. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. Technical Report.
  4. Pfau, J., et al. (2025). Chain of Continuous Thought: Latent Space Reasoning in Large Language Models. arXiv preprint (cited as the canonical COCoT paper).
  5. Geirhos, R., et al. (2024). "Shortcut Learning" in Deep Neural Networks: An Information Bottleneck Perspective. Nature Machine Intelligence.
  6. Tishby, N., & Zaslavsky, N. (2015). Deep Learning and the Information Bottleneck Principle. IEEE Information Theory Workshop.
  7. Villani, C. (2009). Optimal Transport: Old and New. Grundlehren der mathematischen Wissenschaften, Springer.
  8. Shen, Z., et al. (2025). Test-Time Scaling Laws for Latent Reasoning. arXiv preprint.
  9. OpenAI. (2024). Learning to Reason with LLMs: o1 System Card. Technical Report.
  10. Anthropic. (2025). Claude 3.7 Sonnet Extended Thinking: Architecture and Evaluation. Technical Report.
  11. Welling, M., & Teh, Y. W. (2011). Bayesian Learning via Stochastic Gradient Langevin Dynamics. Proceedings of the IEEE.
  12. Gu, A., & Dao, T. (2024). Mamba: Linear-Time Sequence Modeling with Selective State Spaces. COLM 2024.
  13. Fedus, W., et al. (2022). Switch Transformer: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. JMLR.
  14. Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd Edition). MIT Press. (作为 RL 训练目标的通用参考)

一句话摘要:COCoT 通过把推理从离散 token 链搬到连续隐空间链,在信息论上消除了语言化压缩的瓶颈、在几何上统一了 token 级 CoT 与隐空间推理的对偶、在工程上重写了 test-time scaling 的 Pareto 前沿,是 2026 年推理范式跃迁的关键候选。

相关文章

  • 大模型涌现能力的相变标度律 2026:从有限尺寸标度到临界指数普适性的统一形式化7月26日
  • Grokking 的相变理论 2026:从训练阶段跃迁到代数拓扑的统一视角7月25日
  • 大模型损失景观的 Morse 拓扑与模式连通性 20267月24日

评论

加载评论中…

发表评论

返回文章列表