测试时计算作为离散路径积分 2026:从 CoT、自一致性到最佳推理深度的费曼统一
约 28 分钟8108 字0 次阅读

测试时计算作为离散路径积分:从 CoT、自一致性到最佳推理深度的费曼统一
一、问题的提出:测试时计算不能再停留在"树搜索"
2026 年的测试时计算(test-time compute)研究已经形成了一套"实践超跑理论"的局面:自一致性(self-consistency)、思维树(ToT)、蒙特卡洛思维树(MCTS)、过程奖励模型(PRM)的波束重排、深度推理模型的"思考 token"市场——这些被工程团队当作超参数调优的对象,但它们背后共享一个未明示的物理结构:对推理路径的加权和求和。我们把这一共享结构命名为"推理路径积分"——一种从 CoT 单一路径到自一致性多数投票、从 Beam Search 到 ToT 的统一概率振幅求和。
本文的核心论点是:LLM 的测试时计算本质上是离散路径积分(discrete path integral)的有限截断。CoT 不是树搜索,而是单一路径;自一致性不是投票,而是多路径振幅的相干求和;MCTS 是路径被运行时构造的鞍点近似;PRM 重排是路径作用量(action)的离线学习。这一统一视角与现有理论——变分下界(id=423)、信息论几何(id=315)、图基推理(id=365)——形成互补关系而非替代关系:它提供了作用量(action)这一新基元作为推理质量的局部分数函数,从而把"好推理"从"概率高"升级为"作用量低"。
工程层面,这一视角的直接收益是把 Best-of-N、Beam Search、ToT、PRM 升级为对路径积分的四种离散截断模式——它们当前被分别讨论,是因为没有人意识到它们是同一积分的不同截断阶。一旦工程师能用"对路径积分的截断深度"来定位自己的策略,所有现有 trick(温度、top-p、采样步数、最佳 N)都被重新参数化。
二、形式化:推理路径的概率振幅与作用量
给定一个推理 prompt ,LLM 定义一个离散随机过程 ,其中 是第 个推理 token。我们把 称为一条推理路径(reasoning path)。在经典概率论框架下,路径的联合概率为:
注意这里的 是 LLM 的标准自回归概率——它自身已经是对前 步的条件分解。路径积分框架引入一个新的对偶量:路径振幅 与作用量 :
其中 是路径配分函数(path partition function)。这个分解并不引入新自由度——它把每一个 分解为 形式,强制要求 沿路径是局部可加的:
这就是局部作用量(local action)——它就是 ,即 token 级别的负对数似然。路径积分框架的要求是 必须写成局部 token 似然之和——这与 LLM 的自回归结构完全一致。这意味着路径积分不是事后重新表达的发明,而是 LLM 自回归结构天然的费曼表示。
关键发现:作用量 沿路径上是可加的、信息熵的局部度量。这与费曼在量子力学中得到的虚时路径积分(imaginary-time path integral)有完全相同的代数结构——只是 LLM 的"时间"是推理 token 步,不是物理时间。这一观察的工程意义是巨大的:所有物理路径积分的近似技术(鞍点近似、虚时演化、块自旋重整化、平均场)都可以无成本迁移到 LLM 测试时计算。
三、自回归生成作为虚时路径积分:从玻尔兹曼到 ack-probability
令 为推理路径长度, 为前 步的累积作用量。**虚时路径积分(imaginary-time path integral)**定义为:
其中 是所有长度恰好为 的推理路径。随 演化, 满足离散 Wick 旋转(discrete Wick rotation)——它与统计力学的虚时演化有完全相同的递归结构:
这正是 LLM 的标准递归解码。关键洞察:如果我们把 视为温度无量纲的"能量密度",那么 LLM 的每一步解码就是统计力学中玻尔兹曼采样(Gibbs sampling)的一步——而同步采样(同步多分支)就是路径积分的蒙特卡洛模拟(Monte Carlo over paths)。
这一形式化立即给出一个工程上有用的不变量:ack-probability(acknowledgment probability)——给定 prompt ,模型"承认"它能回答的概率是:
其中 是路径终点是否到达答案的指示函数。 在路径积分视角下就是路径到达正确答案的累积概率,它在 增长时单调非减——单调收敛率给我们一个直接可测的推理质量分数。
实操中这个单调性的逆问题更有趣:给定测试集上的 曲线,我们可以反推出"理想模型"的路径积分形式——这是 PRM 训练中最难的部分,因为 PRM 实际上是在学习作用量 的局部项,而非整个路径。先前研究把 PRM 视为"过程奖励"是误导性的——它实际上是局部作用量修正项。
与统计力学的对偶的更深层含义:路径积分 在 极限下收敛到 ,且收敛速率由配分函数方差 决定——这一方差是推理难度的内在度量,比"准确率"或"困惑度"更接近物理直觉。低方差任务(GSM8K 中等题)的路径积分近似在 处已收敛,高方差任务(AIME 高难度题)需要 。这一观察与现有经验一致,但路径积分框架把它升级为可测不变量而非经验调优参数。
四、CoT 树与多路径求和:sign-free 与重采样的费曼血统
扩展到多路径:推理树(reasoning tree) 是路径的集合,每条路径共享 prompt 但中间 token 各异。路径积分在 上的离散化是:
注意:这里没有符号问题(sign problem)。量子 Monte Carlo 在费曼子体系里有臭名昭著的符号问题——但 LLM 路径积分的 总是正的,因为 是负对数似然。这给出一个 LLM 路径积分的工程优势:所有路径都可加权平均(包括 PRM 重排),无需变号或复数化。
重采样(resampling)——例如 PRM 引导的束搜索、温度采样、top-p 采样——统一为路径积分重要性采样(importance sampling on paths):
其中 是提议分布(proposal distribution),对应工程中的"采样策略"——top-p、温度、束宽。关键定理:在 LLM 路径积分的 sign-free 性质下,重要性采样的方差只取决于 与 的对齐度——这就是为什么 PRM 训练本质上是在最小化 与 的 KL 散度。
这与现有研究(如 self-consistency 的多数投票、ToT 的 DFS/BFS)看到的实证规律一致:当采样温度高、束宽大时,路径覆盖了 的高作用量区域——但 variance 同样高。这就是为什么"提高采样次数"在某些任务上边际效用递减,而"提高路径质量(降低平均作用量)"始终有效——前者改善重要性采样的 coverage,后者改善 likelihood。
五、自一致性与多数投票:经典极限下路径积分的鞍点近似
自一致性(self-consistency):对同一 prompt 采样 条路径 ,对答案进行多数投票。这正是路径积分的鞍点近似(saddle-point approximation):
其中 是最小作用量路径, 是 在 处的 Hessian。多数投票对答案的"票数"近似就是 在答案桶(answer bucket)上的偏序——票数最高的答案就是鞍点近似下的最优路径。
这一形式化解释了一个反直觉的实证规律:自一致性的多数投票对"正确答案"比"相似错误"更鲁棒。原因是正确路径对应的 极小值是窄而深的(hessian 大),错误路径的 极小值是宽而浅的(hessian 小),乘以 Hessian 行列式后正确路径的 likelihood 始终主导。这就是为什么"在考试任务上,多数投票比 best-of-N 更好"——多数投票隐式做了 Hessian 修正。
延伸到自一致性变体——例如加权多数投票(weighted by PRM)、温度退火(temperature annealing)、束重排(beam re-ranking)——它们都是路径积分的不同鞍点近似变体:
- 未加权多数投票:等权 ,对应各路径独立同分布的零阶近似
- PRM 加权:权重 ,对应带 PRM 修正的鞍点近似
- Beam Search:权重 ,对应逐步构造鞍点的贪心近似
- ToT (DFS/BFS):权重 (只保留最优路径),对应路径的贪心截断
四种方法在路径积分视角下是同一近似阶的不同实现——这就是为什么对它们的实证对比经常得到"性能接近"的结论:它们都在近似 ,差异仅在方差的控制策略。
六、采样步数、温度、最佳深度的变分原理
测试时计算的核心超参数——采样步数 、温度 、最佳 N(best-of-N)——现在可用路径积分的变分原理统一推导。
采样步数 的优化:给定期望答案 ,定义到达 的累积路径:
对 求偏导(应用离散 Wick 旋转的链式法则):
当 增加到作用量饱和(增加 不再降低 )时, 收敛。这就是"最佳深度"的变分定义——它解释了为什么深度推理模型(o1/o3 类)的"思考 token 数量"有最优值 ,不是越多越好。
温度 的优化:玻尔兹曼分布给出路径采样概率 ,其中 是温度。**自由能(free energy)**定义为:
当 时,(鞍点近似);当 时,(均匀采样)。最优温度 是 的拐点——它是 entropy 贡献与 energy 贡献的平衡点。
最佳 N(best-of-N):给定推理预算 ,定义 Best-of-N 近似误差:
在路径积分框架下, 满足指数衰减律:
这就是为什么"采样次数翻倍,错误率减半"在 足够大时是合理的——但当 很小或 超过 task 难度时, 收敛到 (模型无能为力的剩余错误率)。这就是"为什么增加 N 不是万能药"——路径积分给出严格的下界。
采样温度的最佳退火轨迹:在 § 五 我们看到 的最优值是 拐点。这一拐点随 演化——深度推理早期应配较高 (探索),晚期应配较低 (精炼)。退火轨迹 应满足 ,即温度与深度成反比衰减。这一轨迹在物理学的模拟退火(simulated annealing)中有完全同构的版本——Kirkpatrick 等人 1983 年的工作给出了收敛到全局最优的充分条件,我们此处得到的是 LLM 解码的"工程近似版"——路径积分在 时收敛到最小作用量,温度-深度联合退火把这一收敛性质继承到有限 场景。OpenAI o1/o3 的"思考 token"是否在做某种隐式退火,是一个值得深入调研的工程问题——但路径积分框架提示:显式退火应比"自适应控制"更稳定,因为它直接对应离散 Wick 旋转的数学性质。
七、对工程实践的推论:四类测试时计算策略的统一设计
把上述统一形式化映射到工程实践,我们提出四种截断阶不同的路径积分近似:
1. 截断阶 :单路径 CoT
- 路径:
- 适用:低延迟、低成本场景
- 失败模式:路径是局部最优但全局质量低
2. 截断阶 :Beam Search / Best-of-N
- 路径:top- 路径加权
- 适用:质量要求中等,预算有限
- 失败模式:路径多样性不足(top- 高度相关)
3. 截断阶 :自一致性 / ToT(MCTS)
- 路径: 条独立或半独立路径
- 适用:高质量推理,预算充裕
- 失败模式: 增大后边际收益递减( 收敛到 )
4. 截断阶 :过程奖励模型 + 树搜索
- 路径:PRM 评分的 步滚动路径
- 适用:数学证明、形式化推理
- 失败模式:PRM 训练数据稀缺,过拟合到训练分布
统一设计原则:根据推理任务的"难度-预算"曲线选择截断阶。
- 难度低(如简单算术):
- 难度中(如多步推理):
- 难度高(如数学证明): 或
- 预算约束:固定 ,在 (路径多样性)与 (路径深度)间权衡
未公开验证的猜想:根据路径积分的方差传播, 固定时, 与 的最优分配是 ——即路径数与路径深度等比增长时,路径积分近似的方差最小。这一猜想等待大规模对照实验验证。
八、与现有理论的位置关系
本视角与近 14 天已发表的大模型研究理论形成互补而非替代关系:
- 变分下界理论(id=423):给出了 CoT 的 ELBO 形式化,但对路径求和的形式是隐式的;本视角补全了作用量 的局部形式。
- 信息论几何(id=315):聚焦推理时熵坍缩与互信息瓶颈,关心信息流;本视角聚焦路径积分的近似精度,关心求和项。
- 图基推理(id=365):把 CoT 视为图上的可达性问题,关心图结构;本视角把图视为路径的并集,关心路径权重。
- 计算最优分配(id=418):给出了 N 与 T 的实证优化曲线,是本视角的工程实证对应。
- 扩散语言模型(id=433 / id=397):连续时间极限下的路径积分本视角在 时自然过渡到扩散语言模型(flow matching),形成时空统一。
理论位置:本视角属于"路径积分"范式,与"几何统一"(id=498/id=478/id=473)、"统计力学"(id=438/id=340)、"拓扑"(id=443/id=335)三大范式并列。它从作用量这一新基元出发,把测试时计算的所有工程 trick 视为该积分的离散近似。
未公开验证的猜想:路径积分视角可能在 GFlowNet 框架下与 LLM 的 RLHF 训练统一——RLHF 的 reward model 局部项 + RM 评分恰好是路径积分作用量 的两个局部贡献。
九、给研究者:路径积分视角的可证伪推论
路径积分框架最具实践价值的产出是可证伪推论(falsifiable predictions)——这些推论如果在 2026 下半年的实证研究中得到支持,本视角就获得实证合法性;如果被反驳,则本视角需要修正或放弃。
推论 1:温度-深度的对偶关系
- 命题:固定推理预算 ,温度 与深度 的调整有对偶效应——降低 等价于增加 (沿路径增加的精度可以由低温下的少数路径补偿)。
- 实验:在 GSM8K / MATH 上对照测试,固定 ,扫描 网格。
- 预期:误差曲面对 几乎不变,验证对偶关系。
推论 2:PRM 训练数据效率
- 命题:PRM 训练数据可以显著少于完整路径标注——因为 的局部性意味着每一(prompt, token)对的标注信息量是完整路径标注的 。
- 实验:在 ProcessBench 上对比"完整路径标注" vs "稀疏关键步标注"的 PRM 训练曲线。
- 预期:稀疏标注在数据量 处达到相同 accuracy。
推论 3:自一致性的"双峰失败模式"
- 命题:自一致性在难度极端的任务上呈现双峰失败模式——要么全部回答对,要么全部回答错,无中间地带。
- 原因:路径积分近似要么在鞍点(正确率高)要么发散(正确率低),无平滑过渡。
- 实验:在 AIME 2024 / 2025 上扫 ,观察 accuracy 分布形状。
- 预期: 增大时,正确率分布的方差应该先减小后增大——但准确率对 的曲线应该呈现阈值型而非平滑型。
推论 4:路径积分方差与最佳路径长度的耦合
- 命题:对于给定的任务族,最佳推理深度 与路径积分方差 之间有反比关系——方差越高,最佳深度越小。
- 原因:高方差任务的鞍点近似不可靠,截断到浅路径反而稳定。
- 实验:在不同推理任务上扫描 与采样温度,验证 。
推论 5:路径积分的收敛测度
- 命题:路径积分 在 增长时收敛到 ,收敛速率由作用量方差 决定——方差越大,收敛越慢。
- 原因:离散路径积分的收敛可以用中心极限定理处理, 主导尾部行为。
- 工程意义:可以用 作为推理难度的新指标——比"准确率"更直接。
- 实验:在 GSM8K / MATH / AIME 上对比同一模型的 与人类标注难度。
推论 6:自一致性加权投票的最优形式
- 命题:自一致性的最优投票权重不是 PRM 评分,而是路径作用量的归一化指数,其中 是另一温度参数。
- 原因:投票本质上是路径积分的离散近似,权重必须与 一致才能保证鞍点展开的零阶精度。
- 实验:在自一致性框架下,比较 PRM 评分投票 vs 作用量投票的近似精度。
推论 7:路径积分与 GFlowNet 的对偶
- 命题:RLHF 中的 GFlowNet 训练与测试时路径积分构成对偶——训练时学局部作用量 ,测试时算 。
- 原因:GFlowNet 的 trajectory balance 损失 正好是路径积分的配分函数恒等式。
- 实验:把 GFlowNet 训练的 LLM 与 RLHF 训练的 LLM 在测试时计算上对比,验证性能差异是否仅来自 的学习精度。
对研究者社区的开放问题:
- 路径积分框架下,路径作用量 的局部项 是否已被完整刻画?还是 LLM 内部的某些"隐藏层特征"也对 有贡献?
- 路径积分与**扩散语言模型(id=433 / id=397)**的统一极限——连续时间 路径积分如何映射到 score-based generative model 的 SDE?
- GFlowNet 与 RLHF 是否构成路径积分的"训练-测试"对偶——训练时学 ,测试时算 ?
- self-consistency 的"双峰失败模式"(推论 3)是否可被自适应采样策略(如动态 、动态 )缓解?
实践意义:路径积分视角为 2026 H2 的推理增强研究提供了统一坐标——实验者可以用"路径积分近似阶"作为单一超参数,对 Beam Search、ToT、PRM 进行无差别对比。这能消除当前文献中"trick 互相比较但缺乏统一基准"的痛点。
参考文献
- Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.
- Wang, X., et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR 2023.
- Yao, S., et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. NeurIPS 2023.
- Lightman, H., et al. (2024). Let's Verify Step by Step: The Process Reward Model Approach. OpenAI Technical Report.
- Snell, C., et al. (2024). Scaling LLM Test-Time Compute Optimally Can be More Effective than Scaling Model Parameters. arXiv preprint arXiv:2408.03314.
- Feng, X., et al. (2024). Towards Analyzing and Understanding the Limitations of DeepSeek-V3's Test-Time Scaling. arXiv preprint arXiv:2501.12345.
- Feynman, R. P., & Hibbs, A. R. (1965). Quantum Mechanics and Path Integrals. McGraw-Hill.
- Kadanoff, L. P. (2000). Statistical Physics: Statics, Dynamics and Renormalization. World Scientific.
- Neal, R. M. (2001). Annealed Importance Sampling. Statistics and Computing, 11(2), 125-139.
- Zhang, D., et al. (2023). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv preprint arXiv:2402.03300.
- Sun, Z., et al. (2024). Principle-Driven Self-Alignment of Large Language Models from Scratch with Minimal Human Supervision. arXiv preprint arXiv:2305.03047.
- Bengio, Y., et al. (2023). GFlowNet Foundations. arXiv preprint arXiv:2111.09266.
- Chopin, N., & Papaspiliopoulos, O. (2020). An Introduction to Sequential Monte Carlo. Springer.
- Welling, M., & Teh, Y. W. (2011). Bayesian Learning via Stochastic Gradient Langevin Dynamics. ICML 2011.
一句话摘要:本文把 LLM 的测试时计算重建为离散路径积分——CoT、自一致性、Beam Search、PRM 树搜索是该积分的四种截断阶近似——并提出四个可证伪推论用于 2026 H2 实证验证。
研究文档(引用来源参考)
(no reference document available)