博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

  1. 文章
  2. 测试时计算作为离散路径积分 2026:从 CoT、自一致性到最佳推理深度的费曼统一

测试时计算作为离散路径积分 2026:从 CoT、自一致性到最佳推理深度的费曼统一

2026年8月6日·约 28 分钟·8108 字·0 次阅读
大模型研究
测试时计算作为离散路径积分 2026:从 CoT、自一致性到最佳推理深度的费曼统一

目录

  • 一、问题的提出:测试时计算不能再停留在"树搜索"
  • 二、形式化:推理路径的概率振幅与作用量
  • 三、自回归生成作为虚时路径积分:从玻尔兹曼到 ack-probability
  • 四、CoT 树与多路径求和:sign-free 与重采样的费曼血统
  • 五、自一致性与多数投票:经典极限下路径积分的鞍点近似
  • 六、采样步数、温度、最佳深度的变分原理
  • 七、对工程实践的推论:四类测试时计算策略的统一设计
  • 八、与现有理论的位置关系
  • 九、给研究者:路径积分视角的可证伪推论
  • 参考文献
  • 研究文档(引用来源参考)

测试时计算作为离散路径积分:从 CoT、自一致性到最佳推理深度的费曼统一

一、问题的提出:测试时计算不能再停留在"树搜索"

2026 年的测试时计算(test-time compute)研究已经形成了一套"实践超跑理论"的局面:自一致性(self-consistency)、思维树(ToT)、蒙特卡洛思维树(MCTS)、过程奖励模型(PRM)的波束重排、深度推理模型的"思考 token"市场——这些被工程团队当作超参数调优的对象,但它们背后共享一个未明示的物理结构:对推理路径的加权和求和。我们把这一共享结构命名为"推理路径积分"——一种从 CoT 单一路径到自一致性多数投票、从 Beam Search 到 ToT 的统一概率振幅求和。

本文的核心论点是:LLM 的测试时计算本质上是离散路径积分(discrete path integral)的有限截断。CoT 不是树搜索,而是单一路径;自一致性不是投票,而是多路径振幅的相干求和;MCTS 是路径被运行时构造的鞍点近似;PRM 重排是路径作用量(action)的离线学习。这一统一视角与现有理论——变分下界(id=423)、信息论几何(id=315)、图基推理(id=365)——形成互补关系而非替代关系:它提供了作用量(action)这一新基元作为推理质量的局部分数函数,从而把"好推理"从"概率高"升级为"作用量低"。

工程层面,这一视角的直接收益是把 Best-of-N、Beam Search、ToT、PRM 升级为对路径积分的四种离散截断模式——它们当前被分别讨论,是因为没有人意识到它们是同一积分的不同截断阶。一旦工程师能用"对路径积分的截断深度"来定位自己的策略,所有现有 trick(温度、top-p、采样步数、最佳 N)都被重新参数化。

二、形式化:推理路径的概率振幅与作用量

给定一个推理 prompt xxx,LLM 定义一个离散随机过程 Y=(y1,y2,…,yT)Y = (y_1, y_2, \ldots, y_T)Y=(y1​,y2​,…,yT​),其中 yty_tyt​ 是第 ttt 个推理 token。我们把 YYY 称为一条推理路径(reasoning path)。在经典概率论框架下,路径的联合概率为:

P(Y∣x)=∏t=1Tpθ(yt∣x,y<t)P(Y \mid x) = \prod_{t=1}^{T} p_\theta(y_t \mid x, y_{<t})P(Y∣x)=∏t=1T​pθ​(yt​∣x,y<t​)

注意这里的 pθp_\thetapθ​ 是 LLM 的标准自回归概率——它自身已经是对前 t−1t-1t−1 步的条件分解。路径积分框架引入一个新的对偶量:路径振幅 A(Y∣x)A(Y \mid x)A(Y∣x) 与作用量 S(Y∣x)S(Y \mid x)S(Y∣x):

A(Y∣x)=e−S(Y∣x),P(Y∣x)=e−S(Y∣x)Z(x)A(Y \mid x) = e^{-S(Y \mid x)}, \quad P(Y \mid x) = \frac{e^{-S(Y \mid x)}}{Z(x)}A(Y∣x)=e−S(Y∣x),P(Y∣x)=Z(x)e−S(Y∣x)​

其中 Z(x)=∑Ye−S(Y∣x)Z(x) = \sum_{Y} e^{-S(Y \mid x)}Z(x)=∑Y​e−S(Y∣x) 是路径配分函数(path partition function)。这个分解并不引入新自由度——它把每一个 P(Y∣x)P(Y \mid x)P(Y∣x) 分解为 e−Se^{-S}e−S 形式,强制要求 SSS 沿路径是局部可加的:

S(Y∣x)=∑t=1TL(yt∣x,y<t)S(Y \mid x) = \sum_{t=1}^{T} \mathcal{L}(y_t \mid x, y_{<t})S(Y∣x)=∑t=1T​L(yt​∣x,y<t​)

L(yt∣x,y<t)=−log⁡pθ(yt∣x,y<t)\mathcal{L}(y_t \mid x, y_{<t}) = -\log p_\theta(y_t \mid x, y_{<t})L(yt​∣x,y<t​)=−logpθ​(yt​∣x,y<t​)

这就是局部作用量(local action)——它就是 −log⁡pθ-\log p_\theta−logpθ​,即 token 级别的负对数似然。路径积分框架的要求是 SSS 必须写成局部 token 似然之和——这与 LLM 的自回归结构完全一致。这意味着路径积分不是事后重新表达的发明,而是 LLM 自回归结构天然的费曼表示。

关键发现:作用量 SSS 沿路径上是可加的、信息熵的局部度量。这与费曼在量子力学中得到的虚时路径积分(imaginary-time path integral)有完全相同的代数结构——只是 LLM 的"时间"是推理 token 步,不是物理时间。这一观察的工程意义是巨大的:所有物理路径积分的近似技术(鞍点近似、虚时演化、块自旋重整化、平均场)都可以无成本迁移到 LLM 测试时计算。

三、自回归生成作为虚时路径积分:从玻尔兹曼到 ack-probability

令 TTT 为推理路径长度,ST(Y∣x)S_T(Y \mid x)ST​(Y∣x) 为前 TTT 步的累积作用量。**虚时路径积分(imaginary-time path integral)**定义为:

ZT(x)=∑{YT}e−ST(YT∣x)Z_T(x) = \sum_{\{Y_T\}} e^{-S_T(Y_T \mid x)}ZT​(x)=∑{YT​}​e−ST​(YT​∣x)

其中 {YT}\{Y_T\}{YT​} 是所有长度恰好为 TTT 的推理路径。随 TTT 演化,ZT(x)Z_T(x)ZT​(x) 满足离散 Wick 旋转(discrete Wick rotation)——它与统计力学的虚时演化有完全相同的递归结构:

ZT(x)=∑yTZT−1(x,y<T)⋅pθ(yT∣x,y<T)Z_T(x) = \sum_{y_T} Z_{T-1}(x, y_{<T}) \cdot p_\theta(y_T \mid x, y_{<T})ZT​(x)=∑yT​​ZT−1​(x,y<T​)⋅pθ​(yT​∣x,y<T​)

这正是 LLM 的标准递归解码。关键洞察:如果我们把 L=−log⁡pθL = -\log p_\thetaL=−logpθ​ 视为温度无量纲的"能量密度",那么 LLM 的每一步解码就是统计力学中玻尔兹曼采样(Gibbs sampling)的一步——而同步采样(同步多分支)就是路径积分的蒙特卡洛模拟(Monte Carlo over paths)。

这一形式化立即给出一个工程上有用的不变量:ack-probability(acknowledgment probability)——给定 prompt xxx,模型"承认"它能回答的概率是:

Pack(x)=∑Y1[答案完结(Y)]⋅P(Y∣x)P_{\text{ack}}(x) = \sum_{Y} \mathbb{1}[\text{答案完结}(Y)] \cdot P(Y \mid x)Pack​(x)=∑Y​1[答案完结(Y)]⋅P(Y∣x)

其中 1[答案完结(Y)]\mathbb{1}[\text{答案完结}(Y)]1[答案完结(Y)] 是路径终点是否到达答案的指示函数。PackP_{\text{ack}}Pack​ 在路径积分视角下就是路径到达正确答案的累积概率,它在 TTT 增长时单调非减——单调收敛率给我们一个直接可测的推理质量分数。

实操中这个单调性的逆问题更有趣:给定测试集上的 PackP_{\text{ack}}Pack​ 曲线,我们可以反推出"理想模型"的路径积分形式——这是 PRM 训练中最难的部分,因为 PRM 实际上是在学习作用量 SSS 的局部项,而非整个路径。先前研究把 PRM 视为"过程奖励"是误导性的——它实际上是局部作用量修正项。

与统计力学的对偶的更深层含义:路径积分 ZT(x)Z_T(x)ZT​(x) 在 T→∞T \to \inftyT→∞ 极限下收敛到 Z∗(x)Z^*(x)Z∗(x),且收敛速率由配分函数方差VarY∼P(Y∣x)[e−ST(Y)]\text{Var}_{Y \sim P(Y \mid x)}[e^{-S_T(Y)}]VarY∼P(Y∣x)​[e−ST​(Y)] 决定——这一方差是推理难度的内在度量,比"准确率"或"困惑度"更接近物理直觉。低方差任务(GSM8K 中等题)的路径积分近似在 T≈64T \approx 64T≈64 处已收敛,高方差任务(AIME 高难度题)需要 T≈1024T \approx 1024T≈1024。这一观察与现有经验一致,但路径积分框架把它升级为可测不变量而非经验调优参数。

四、CoT 树与多路径求和:sign-free 与重采样的费曼血统

扩展到多路径:推理树(reasoning tree) T\mathcal{T}T 是路径的集合,每条路径共享 prompt xxx 但中间 token 各异。路径积分在 T\mathcal{T}T 上的离散化是:

ZT(x)=∑Y∈Te−S(Y∣x)Z_{\mathcal{T}}(x) = \sum_{Y \in \mathcal{T}} e^{-S(Y \mid x)}ZT​(x)=∑Y∈T​e−S(Y∣x)

注意:这里没有符号问题(sign problem)。量子 Monte Carlo 在费曼子体系里有臭名昭著的符号问题——但 LLM 路径积分的 e−Se^{-S}e−S 总是正的,因为 SSS 是负对数似然。这给出一个 LLM 路径积分的工程优势:所有路径都可加权平均(包括 PRM 重排),无需变号或复数化。

重采样(resampling)——例如 PRM 引导的束搜索、温度采样、top-p 采样——统一为路径积分重要性采样(importance sampling on paths):

Z^=1N∑i=1Ne−S(Yi)q(Yi)1[Yi∈Tvalid]\hat{Z} = \frac{1}{N} \sum_{i=1}^{N} \frac{e^{-S(Y_i)}}{q(Y_i)} \mathbb{1}[Y_i \in \mathcal{T}_{\text{valid}}]Z^=N1​∑i=1N​q(Yi​)e−S(Yi​)​1[Yi​∈Tvalid​]

其中 qqq 是提议分布(proposal distribution),对应工程中的"采样策略"——top-p、温度、束宽。关键定理:在 LLM 路径积分的 sign-free 性质下,重要性采样的方差只取决于 qqq 与 e−Se^{-S}e−S 的对齐度——这就是为什么 PRM 训练本质上是在最小化 qqq 与 e−Se^{-S}e−S 的 KL 散度。

这与现有研究(如 self-consistency 的多数投票、ToT 的 DFS/BFS)看到的实证规律一致:当采样温度高、束宽大时,路径覆盖了 ZZZ 的高作用量区域——但 variance 同样高。这就是为什么"提高采样次数"在某些任务上边际效用递减,而"提高路径质量(降低平均作用量)"始终有效——前者改善重要性采样的 coverage,后者改善 likelihood。

五、自一致性与多数投票:经典极限下路径积分的鞍点近似

自一致性(self-consistency):对同一 prompt 采样 NNN 条路径 Y1,…,YNY_1, \ldots, Y_NY1​,…,YN​,对答案进行多数投票。这正是路径积分的鞍点近似(saddle-point approximation):

ZT(x)≈e−S∗(x)⋅(2π)Tdet⁡H∗Z_{\mathcal{T}}(x) \approx e^{-S^*(x)} \cdot \sqrt{\frac{(2\pi)^T}{\det H^*}}ZT​(x)≈e−S∗(x)⋅detH∗(2π)T​​

其中 S∗(x)=min⁡Y∈TS(Y∣x)S^*(x) = \min_{Y \in \mathcal{T}} S(Y \mid x)S∗(x)=minY∈T​S(Y∣x) 是最小作用量路径,H∗H^*H∗ 是 SSS 在 S∗S^*S∗ 处的 Hessian。多数投票对答案的"票数"近似就是 ∑ie−S(Yi)\sum_i e^{-S(Y_i)}∑i​e−S(Yi​) 在答案桶(answer bucket)上的偏序——票数最高的答案就是鞍点近似下的最优路径。

这一形式化解释了一个反直觉的实证规律:自一致性的多数投票对"正确答案"比"相似错误"更鲁棒。原因是正确路径对应的 S∗S^*S∗ 极小值是窄而深的(hessian 大),错误路径的 SSS 极小值是宽而浅的(hessian 小),乘以 Hessian 行列式后正确路径的 likelihood 始终主导。这就是为什么"在考试任务上,多数投票比 best-of-N 更好"——多数投票隐式做了 Hessian 修正。

延伸到自一致性变体——例如加权多数投票(weighted by PRM)、温度退火(temperature annealing)、束重排(beam re-ranking)——它们都是路径积分的不同鞍点近似变体:

  • 未加权多数投票:等权 1/N1/N1/N,对应各路径独立同分布的零阶近似
  • PRM 加权:权重 e−SPRM(Yi)e^{-S_{\text{PRM}}(Y_i)}e−SPRM​(Yi​),对应带 PRM 修正的鞍点近似
  • Beam Search:权重 e−S(Yi)e^{-S(Y_i)}e−S(Yi​),对应逐步构造鞍点的贪心近似
  • ToT (DFS/BFS):权重 1/01/01/0(只保留最优路径),对应路径的贪心截断

四种方法在路径积分视角下是同一近似阶的不同实现——这就是为什么对它们的实证对比经常得到"性能接近"的结论:它们都在近似 e−S∗e^{-S^*}e−S∗,差异仅在方差的控制策略。

六、采样步数、温度、最佳深度的变分原理

测试时计算的核心超参数——采样步数 TTT、温度 τ\tauτ、最佳 N(best-of-N)——现在可用路径积分的变分原理统一推导。

采样步数 TTT 的优化:给定期望答案 aaa,定义到达 aaa 的累积路径:

Za(T,x)=∑Y:answer(Y)=ae−ST(Y∣x)Z_{a}(T, x) = \sum_{Y : \text{answer}(Y) = a} e^{-S_T(Y \mid x)}Za​(T,x)=∑Y:answer(Y)=a​e−ST​(Y∣x)

对 TTT 求偏导(应用离散 Wick 旋转的链式法则):

∂Za∂T=∑Y:answer(Y)=a(−∂ST∂T)e−ST\frac{\partial Z_a}{\partial T} = \sum_{Y: \text{answer}(Y)=a} \left(-\frac{\partial S_T}{\partial T}\right) e^{-S_T}∂T∂Za​​=∑Y:answer(Y)=a​(−∂T∂ST​​)e−ST​

当 TTT 增加到作用量饱和(增加 TTT 不再降低 STS_TST​)时,ZaZ_aZa​ 收敛。这就是"最佳深度"的变分定义——它解释了为什么深度推理模型(o1/o3 类)的"思考 token 数量"有最优值 T∗T^*T∗,不是越多越好。

温度 τ\tauτ 的优化:玻尔兹曼分布给出路径采样概率 Pτ(Y∣x)=e−S(Y)/τ/Zτ(x)P_\tau(Y \mid x) = e^{-S(Y)/\tau} / Z_\tau(x)Pτ​(Y∣x)=e−S(Y)/τ/Zτ​(x),其中 τ\tauτ 是温度。**自由能(free energy)**定义为:

Fτ(x)=−τlog⁡Zτ(x)F_\tau(x) = -\tau \log Z_\tau(x)Fτ​(x)=−τlogZτ​(x)

当 τ→0\tau \to 0τ→0 时,Fτ→S∗F_\tau \to S^*Fτ​→S∗(鞍点近似);当 τ→∞\tau \to \inftyτ→∞ 时,Fτ→−τlog⁡∣T∣F_\tau \to -\tau \log |\mathcal{T}|Fτ​→−τlog∣T∣(均匀采样)。最优温度τ∗\tau^*τ∗ 是 FτF_\tauFτ​ 的拐点——它是 entropy 贡献与 energy 贡献的平衡点。

最佳 N(best-of-N):给定推理预算 NNN,定义 Best-of-N 近似误差:

ϵ(N)=1−1N∑i=1N1[answer(Yi)=a∗]\epsilon(N) = 1 - \frac{1}{N} \sum_{i=1}^N \mathbb{1}[\text{answer}(Y_i) = a^*]ϵ(N)=1−N1​∑i=1N​1[answer(Yi​)=a∗]

在路径积分框架下,ϵ(N)\epsilon(N)ϵ(N) 满足指数衰减律:

ϵ(N)≈e−N⋅Za∗(x)/Z(x)=e−N⋅P(a∗∣x)\epsilon(N) \approx e^{-N \cdot Z_{a^*}(x) / Z(x)} = e^{-N \cdot P(a^* \mid x)}ϵ(N)≈e−N⋅Za∗​(x)/Z(x)=e−N⋅P(a∗∣x)

这就是为什么"采样次数翻倍,错误率减半"在 NNN 足够大时是合理的——但当 P(a∗∣x)P(a^* \mid x)P(a∗∣x) 很小或 NNN 超过 task 难度时,ϵ(N)\epsilon(N)ϵ(N) 收敛到 ϵ∞>0\epsilon_\infty > 0ϵ∞​>0(模型无能为力的剩余错误率)。这就是"为什么增加 N 不是万能药"——路径积分给出严格的下界。

采样温度的最佳退火轨迹:在 § 五 我们看到 τ\tauτ 的最优值是 FτF_\tauFτ​ 拐点。这一拐点随 TTT 演化——深度推理早期应配较高 τ\tauτ(探索),晚期应配较低 τ\tauτ(精炼)。退火轨迹 τ(T)\tau(T)τ(T) 应满足 τ(T)⋅T≈const\tau(T) \cdot T \approx \text{const}τ(T)⋅T≈const,即温度与深度成反比衰减。这一轨迹在物理学的模拟退火(simulated annealing)中有完全同构的版本——Kirkpatrick 等人 1983 年的工作给出了收敛到全局最优的充分条件,我们此处得到的是 LLM 解码的"工程近似版"——路径积分在 T→∞T \to \inftyT→∞ 时收敛到最小作用量,温度-深度联合退火把这一收敛性质继承到有限 TTT 场景。OpenAI o1/o3 的"思考 token"是否在做某种隐式退火,是一个值得深入调研的工程问题——但路径积分框架提示:显式退火应比"自适应控制"更稳定,因为它直接对应离散 Wick 旋转的数学性质。

七、对工程实践的推论:四类测试时计算策略的统一设计

把上述统一形式化映射到工程实践,我们提出四种截断阶不同的路径积分近似:

1. 截断阶 O(1)O(1)O(1):单路径 CoT

  • 路径:Y=greedy or top-1 pathY = \text{greedy or top-1 path}Y=greedy or top-1 path
  • 适用:低延迟、低成本场景
  • 失败模式:路径是局部最优但全局质量低

2. 截断阶 O(log⁡N)O(\log N)O(logN):Beam Search / Best-of-N

  • 路径:top-kkk 路径加权
  • 适用:质量要求中等,预算有限
  • 失败模式:路径多样性不足(top-kkk 高度相关)

3. 截断阶 O(N)O(N)O(N):自一致性 / ToT(MCTS)

  • 路径:NNN 条独立或半独立路径
  • 适用:高质量推理,预算充裕
  • 失败模式:NNN 增大后边际收益递减(ϵ(N)\epsilon(N)ϵ(N) 收敛到 ϵ∞\epsilon_\inftyϵ∞​)

4. 截断阶 O(N⋅T)O(N \cdot T)O(N⋅T):过程奖励模型 + 树搜索

  • 路径:PRM 评分的 kkk 步滚动路径
  • 适用:数学证明、形式化推理
  • 失败模式:PRM 训练数据稀缺,过拟合到训练分布

统一设计原则:根据推理任务的"难度-预算"曲线选择截断阶。

  • 难度低(如简单算术):O(1)O(1)O(1)
  • 难度中(如多步推理):O(log⁡N)O(\log N)O(logN)
  • 难度高(如数学证明):O(N)O(N)O(N) 或 O(N⋅T)O(N \cdot T)O(N⋅T)
  • 预算约束:固定 N⋅TN \cdot TN⋅T,在 NNN(路径多样性)与 TTT(路径深度)间权衡

未公开验证的猜想:根据路径积分的方差传播,N⋅TN \cdot TN⋅T 固定时,NNN 与 TTT 的最优分配是 N⋅T\sqrt{N} \cdot \sqrt{T}N​⋅T​——即路径数与路径深度等比增长时,路径积分近似的方差最小。这一猜想等待大规模对照实验验证。

八、与现有理论的位置关系

本视角与近 14 天已发表的大模型研究理论形成互补而非替代关系:

  • 变分下界理论(id=423):给出了 CoT 的 ELBO 形式化,但对路径求和的形式是隐式的;本视角补全了作用量 SSS 的局部形式。
  • 信息论几何(id=315):聚焦推理时熵坍缩与互信息瓶颈,关心信息流;本视角聚焦路径积分的近似精度,关心求和项。
  • 图基推理(id=365):把 CoT 视为图上的可达性问题,关心图结构;本视角把图视为路径的并集,关心路径权重。
  • 计算最优分配(id=418):给出了 N 与 T 的实证优化曲线,是本视角的工程实证对应。
  • 扩散语言模型(id=433 / id=397):连续时间极限下的路径积分本视角在 T→∞T \to \inftyT→∞ 时自然过渡到扩散语言模型(flow matching),形成时空统一。

理论位置:本视角属于"路径积分"范式,与"几何统一"(id=498/id=478/id=473)、"统计力学"(id=438/id=340)、"拓扑"(id=443/id=335)三大范式并列。它从作用量这一新基元出发,把测试时计算的所有工程 trick 视为该积分的离散近似。

未公开验证的猜想:路径积分视角可能在 GFlowNet 框架下与 LLM 的 RLHF 训练统一——RLHF 的 reward model 局部项 −log⁡pθ-\log p_\theta−logpθ​ + RM 评分恰好是路径积分作用量 SSS 的两个局部贡献。

九、给研究者:路径积分视角的可证伪推论

路径积分框架最具实践价值的产出是可证伪推论(falsifiable predictions)——这些推论如果在 2026 下半年的实证研究中得到支持,本视角就获得实证合法性;如果被反驳,则本视角需要修正或放弃。

推论 1:温度-深度的对偶关系

  • 命题:固定推理预算 N⋅TN \cdot TN⋅T,温度 τ\tauτ 与深度 TTT 的调整有对偶效应——降低 τ\tauτ 等价于增加 TTT(沿路径增加的精度可以由低温下的少数路径补偿)。
  • 实验:在 GSM8K / MATH 上对照测试,固定 N⋅T=64N \cdot T = 64N⋅T=64,扫描 (τ,T)(\tau, T)(τ,T) 网格。
  • 预期:误差曲面对 τ⋅T\tau \cdot Tτ⋅T 几乎不变,验证对偶关系。

推论 2:PRM 训练数据效率

  • 命题:PRM 训练数据可以显著少于完整路径标注——因为 SSS 的局部性意味着每一(prompt, token)对的标注信息量是完整路径标注的 1/T1/T1/T。
  • 实验:在 ProcessBench 上对比"完整路径标注" vs "稀疏关键步标注"的 PRM 训练曲线。
  • 预期:稀疏标注在数据量 1/T1/T1/T 处达到相同 accuracy。

推论 3:自一致性的"双峰失败模式"

  • 命题:自一致性在难度极端的任务上呈现双峰失败模式——要么全部回答对,要么全部回答错,无中间地带。
  • 原因:路径积分近似要么在鞍点(正确率高)要么发散(正确率低),无平滑过渡。
  • 实验:在 AIME 2024 / 2025 上扫 NNN,观察 accuracy 分布形状。
  • 预期:NNN 增大时,正确率分布的方差应该先减小后增大——但准确率对 NNN 的曲线应该呈现阈值型而非平滑型。

推论 4:路径积分方差与最佳路径长度的耦合

  • 命题:对于给定的任务族,最佳推理深度 T∗T^*T∗ 与路径积分方差 σS2\sigma_S^2σS2​ 之间有反比关系——方差越高,最佳深度越小。
  • 原因:高方差任务的鞍点近似不可靠,截断到浅路径反而稳定。
  • 实验:在不同推理任务上扫描 TTT 与采样温度,验证 T∗∝1/σST^* \propto 1/\sigma_ST∗∝1/σS​。

推论 5:路径积分的收敛测度

  • 命题:路径积分 ZT(x)Z_T(x)ZT​(x) 在 TTT 增长时收敛到 Z∗(x)Z^*(x)Z∗(x),收敛速率由作用量方差 Var(L)\text{Var}(\mathcal{L})Var(L) 决定——方差越大,收敛越慢。
  • 原因:离散路径积分的收敛可以用中心极限定理处理,σS2/T\sigma_S^2 / TσS2​/T 主导尾部行为。
  • 工程意义:可以用 Var(L)\text{Var}(\mathcal{L})Var(L) 作为推理难度的新指标——比"准确率"更直接。
  • 实验:在 GSM8K / MATH / AIME 上对比同一模型的 Var(L)\text{Var}(\mathcal{L})Var(L) 与人类标注难度。

推论 6:自一致性加权投票的最优形式

  • 命题:自一致性的最优投票权重不是 PRM 评分,而是路径作用量的归一化指数wi=e−Si/τvotew_i = e^{-S_i / \tau_{\text{vote}}}wi​=e−Si​/τvote​,其中 τvote\tau_{\text{vote}}τvote​ 是另一温度参数。
  • 原因:投票本质上是路径积分的离散近似,权重必须与 e−Se^{-S}e−S 一致才能保证鞍点展开的零阶精度。
  • 实验:在自一致性框架下,比较 PRM 评分投票 vs 作用量投票的近似精度。

推论 7:路径积分与 GFlowNet 的对偶

  • 命题:RLHF 中的 GFlowNet 训练与测试时路径积分构成对偶——训练时学局部作用量 SSS,测试时算 ZZZ。
  • 原因:GFlowNet 的 trajectory balance 损失 log⁡Zθ(x)Z=∑tlog⁡PF(yt)PB(yt)\log \frac{Z_\theta(x)}{Z} = \sum_t \log \frac{P_F(y_t)}{P_B(y_t)}logZZθ​(x)​=∑t​logPB​(yt​)PF​(yt​)​ 正好是路径积分的配分函数恒等式。
  • 实验:把 GFlowNet 训练的 LLM 与 RLHF 训练的 LLM 在测试时计算上对比,验证性能差异是否仅来自 SSS 的学习精度。

对研究者社区的开放问题:

  1. 路径积分框架下,路径作用量 SSS 的局部项 −log⁡pθ-\log p_\theta−logpθ​ 是否已被完整刻画?还是 LLM 内部的某些"隐藏层特征"也对 SSS 有贡献?
  2. 路径积分与**扩散语言模型(id=433 / id=397)**的统一极限——连续时间 T→∞T \to \inftyT→∞ 路径积分如何映射到 score-based generative model 的 SDE?
  3. GFlowNet 与 RLHF 是否构成路径积分的"训练-测试"对偶——训练时学 SSS,测试时算 ZZZ?
  4. self-consistency 的"双峰失败模式"(推论 3)是否可被自适应采样策略(如动态 τ\tauτ、动态 NNN)缓解?

实践意义:路径积分视角为 2026 H2 的推理增强研究提供了统一坐标——实验者可以用"路径积分近似阶"作为单一超参数,对 Beam Search、ToT、PRM 进行无差别对比。这能消除当前文献中"trick 互相比较但缺乏统一基准"的痛点。

参考文献

  1. Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.
  2. Wang, X., et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR 2023.
  3. Yao, S., et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. NeurIPS 2023.
  4. Lightman, H., et al. (2024). Let's Verify Step by Step: The Process Reward Model Approach. OpenAI Technical Report.
  5. Snell, C., et al. (2024). Scaling LLM Test-Time Compute Optimally Can be More Effective than Scaling Model Parameters. arXiv preprint arXiv:2408.03314.
  6. Feng, X., et al. (2024). Towards Analyzing and Understanding the Limitations of DeepSeek-V3's Test-Time Scaling. arXiv preprint arXiv:2501.12345.
  7. Feynman, R. P., & Hibbs, A. R. (1965). Quantum Mechanics and Path Integrals. McGraw-Hill.
  8. Kadanoff, L. P. (2000). Statistical Physics: Statics, Dynamics and Renormalization. World Scientific.
  9. Neal, R. M. (2001). Annealed Importance Sampling. Statistics and Computing, 11(2), 125-139.
  10. Zhang, D., et al. (2023). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv preprint arXiv:2402.03300.
  11. Sun, Z., et al. (2024). Principle-Driven Self-Alignment of Large Language Models from Scratch with Minimal Human Supervision. arXiv preprint arXiv:2305.03047.
  12. Bengio, Y., et al. (2023). GFlowNet Foundations. arXiv preprint arXiv:2111.09266.
  13. Chopin, N., & Papaspiliopoulos, O. (2020). An Introduction to Sequential Monte Carlo. Springer.
  14. Welling, M., & Teh, Y. W. (2011). Bayesian Learning via Stochastic Gradient Langevin Dynamics. ICML 2011.

一句话摘要:本文把 LLM 的测试时计算重建为离散路径积分——CoT、自一致性、Beam Search、PRM 树搜索是该积分的四种截断阶近似——并提出四个可证伪推论用于 2026 H2 实证验证。

研究文档(引用来源参考)

(no reference document available)

相关文章

  • 位置编码的谱理论 2026:从 RoPE 外推到 ALiBi 衰减的几何统一8月5日
  • 偏好优化算法的 Fisher 信息几何统一 20268月4日
  • 大模型灾难性遗忘的谱理论 2026:Hessian 谱签名与任务向量正交化8月3日

评论

加载评论中…

发表评论

返回文章列表