Test-time Compute Scaling 的统计决策理论 2026:从 Chain-of-Thought 到 Compute-Optimal Allocation
一句话摘要:本文以统计决策理论 (Bayes optimal + PAC-Bayes + submodular optimization) 为统一框架,把 2024-2025 年兴起的 test-time compute scaling 四大主流范式 (Chain-of-Thought / Tree-of-Thought / Process Reward Model / Verifier-based Search) 放进同一张 compute-optimal allocation frontier 图,论证"用算力换推理"是大模型继 pretraining scaling 之后的第二条扩展曲线,其增长边界由 verifier 质量而非 base model 容量决定。
一、问题的提出:Test-time compute 是大模型的第二条扩展曲线
2024 年 9 月 OpenAI o1 的发布、2025 年 1 月 DeepSeek R1 的开源复现,把"在 inference 阶段花更多算力"这件事从研究原型推到了工业标准。Anthropic 的 extended thinking mode、Google 的 Gemini 2.0 Thinking、xAI 的 Grok 3 Reasoning 紧随其后,几乎所有头部实验室都在 2025 年上半年把 test-time compute (下文简称 tts) 作为模型发布的核心卖点。这条曲线和 2020-2024 年的 pretraining scaling law 平行展开,Chinchilla 之后大家默认"加大模型要加数据要按比例",而 o1 之后的故事是"加大模型要加 inference 算力,但比例和训练 scaling 完全独立"。
但和训练侧的 scaling law 不同,推理侧的算力投入是非平凡决策:你不能在每条 query 上无脑堆 GPU,因为 latency budget 有限、cost-per-query 有限、verifier 训练数据也有限。这就引出一组基础问题:在固定算力预算 C 下,该把多少算力分给 CoT 长链、多少分给 ToT 分支、多少分给 PRM rollout、多少分给 verifier-based search?这些范式之间是替代关系还是互补关系?同一个 base model 在不同任务上的最优分配曲线长什么样?这些就是 test-time compute 的"统计决策理论"问题。
本文从三个层面回答上述问题:(i) 形式化层,把 tts 抽象为带成本函数的 Markov decision process,给出与 PAC-Bayes 界的对应;(ii) 算法层,把 CoT/ToT/PRM/verifier-search 四个主流范式分别归类为 MCMC 视角、最优分支因子、credit assignment、dual-policy 四类决策算法,证明它们在 variance-bias 平面上的互补关系;(iii) 优化层,给出 compute-optimal allocation 的凸规划定理,Snell et al. (2024) 的 compute-optimal frontier 在多策略 setting 下的严格推广。
需要强调的是,本文讨论的 tts 是 query-level inference compute,与 serving-level 的 batch scheduling、KV cache reuse、speculative decoding 等系统优化不在同一抽象层。后者关心的是"用更少 GPU 时间生成同样质量的输出",前者关心的是"花更多 GPU 时间换取更高质量的输出"。两者的取舍方向相反,工程上往往要联合优化,但统计理论基础完全不同 —— tts 的理论基础是 statistical decision theory,后者是 systems optimization theory。本文只覆盖前者。
另外,tts 与传统的 inference-time adaptation (如 in-context learning、prompt tuning、test-time training) 也有本质区别。tts 不修改模型参数,只通过增加 compute 来获得更好输出;adaptation 修改模型表征。两者在工程上互补,o3 类系统同时使用两者,但本文聚焦纯 compute scaling 的理论层面。
二、形式化:Test-time Compute 的四元组决策框架
把一次推理 query 抽象为四元组 (s, A, c, V):s 是 query 的隐状态 (包含 prompt、context、hidden requirement),A 是允许的 action 空间 (生成 token、调用 tool、调用 verifier、做 search branch),c: A → ℝ₊ 是每步 action 的算力成本,V: trajectory → ℝ 是 value function (可以由 outcome reward model 给出,也可以由 process reward model 给出,也可以是 ground-truth label)。tts 的目标是在给定总预算 C 下最大化 E[V[τ]],τ ∈ trajectory space。
这与经典 PAC-Bayes 框架对应:每条 trajectory 是一个 hypothesis,V(τ) 是它的 generalization bound 估计,c(τ) 是它的 sample complexity。tts 的总预算 C 等价于 PAC-Bayes 界的 total sample budget,在固定 C 下最大化 E[V] 等价于在固定 KL 散度预算下最小化 expected risk。
一个核心定理 (本文推导) 是:在 binary value setting 下 (V ∈ {0,1}),compute-optimal allocation 是 reward-distillation curve 的次模函数 (submodular function)。具体地,设 f(C) = max_π E_π[V] 为在算力预算 C 下的最优 value,Snell 等人 2024 的实证发现 f(C) 是 C 的对数次线性函数 (log-linear);本文证明这个现象的统计基础是 f 的次模性 —— 也就是说,每多投入一份算力带来的边际收益是单调递减的,且每两份算力的边际收益有 subadditive 上界。次模性直接给出 greedy allocation 的 (1-1/e) 近似比,这是后面 compute-optimal allocation 凸规划的根。
把这个框架套到具体范式:CoT 是固定 action 序列的 single-trajectory policy,ToT 是 tree policy,PRM-based rollout 是带中间 reward 的 early-stopping policy,verifier-search 是 dual-policy (generator + verifier 同时 rollout)。它们都是 π 的特例,差异只在 (action space, value function, cost model) 三元组的参数化方式。
进一步,可以证明上述四元组框架与 sequential decision making 的经典 Bellman 方程对应:V(s) = max_a [c(a) + γ × E_s'|a[V(s')]],其中 γ 是 discount factor (在 tts 中通常取 1,因为 trajectory 是有限长的)。把 Bellman 方程展开到 N 步 planning,得到 V_N(s) 的 closed form,这与 PRM 的 step-level value decomposition 完全一致 —— PRM 实质上是 Bellman value iteration 在 function approximation setting 下的特例。Verifier-search 则对应 Bellman 的 offline value learning,verifier 充当 value network 的近似。
这种对应让 tts 可以无缝接入经典 RL 理论:policy iteration、value iteration、TD-learning、Q-learning 等算法都可以改写到 LLM tts setting。这是从 RL 视角理解 tts 的关键,也是为什么 o1/R1 的训练 pipeline 大量借鉴 RL 算法 (PPO、GRPO、rejection sampling) 的理论根因。
四元组框架还有一个微妙但重要的扩展:当 value function V 不仅是 scalar,而是 vector-valued (multi-objective),tts 就变成 multi-objective RL setting。向量值 V 的 Pareto frontier 等价于 multi-objective RL 的 Pareto policy set,这给出 tts 在 safety + helpfulness + factuality 多目标优化下的理论基础。当前 o1 系列尚未完整实现 multi-objective V,但 Anthropic 的 Constitutional AI 和 OpenAI 的 deliberative alignment 都在向这个方向演进。完整理论框架与具体工程实现仍有显著 gap,这是未来 2-3 年值得重点关注的开放问题。
三、范式一:Chain-of-Thought 的隐式 MCMC 视角
Chain-of-Thought (CoT) 是 tts 最朴素的形式:模型在 answer 之前先生成一段 reasoning trace。从统计视角看,CoT 等价于在隐状态空间做隐式 MCMC sampling:每一步生成一个 token 是一次 proposal,V(τ) 是 acceptance probability (即生成完整 reasoning 后答对的概率)。当 model 的 conditional distribution p_θ(xₜ|x_<t) 接近真实后验时,CoT 等价于 exact posterior sampling;当 p_θ 有偏时,CoT 等价于 importance sampling with self-normalized weights。
Self-consistency @ k (Wang et al., 2023) 是这个视角的直接推论:sample k 条 CoT,取 majority vote,等价于对 k 个 MCMC sample 做 Rao-Blackwellised estimator。Rao-Blackwellisation 的方差缩减是 O(1/k) 在独立采样假设下,在 model 偏置主导的实际 setting 中缩减比是 O(1/√k) (因为不同 sample 共享 model bias)。这给出一个理论上限:self-consistency 在 k → ∞ 时收敛到 1 - Bayes error rate,但收敛速率是次线性的。
一个常被忽视的细节:CoT 的"温度"参数 (sampling temperature) 等价于 MCMC 的 step size τ,τ 越大探索越广但 acceptance 越低,τ 越小收敛越快但易陷入局部最优。Optimum temperature τ* 与 value function 的 local Lipschitz 常数 L_V 成反比 —— 这解释了为什么"hard reasoning task 需要 high temperature"是经验事实 (hard task 的 V 在 trace space 上更不平滑)。Self-consistency 在 τ* 附近的 variance reduction 最大,偏离 τ* 后收益快速衰减,这是 self-consistency 不是"越多越好"的统计根因。
CoT 的局限是 inference cost 是 trajectory-length linear,而 reasoning depth 经常需要 exponential in problem difficulty。Linear scaling 与 exponential requirement 之间的 gap 是 CoT 不能 scale to hard olympiad-style problem 的根因。要 scale 到 hard problem,必须引入 tree branching (ToT) 或 external verification (PRM / verifier-search)。这就是范式演进的内部逻辑 —— 每种新范式都是为了突破前一种范式的 scaling bottleneck。
CoT 的另一个隐性假设是 model 的 conditional distribution p_θ(xₜ|x_<t) 接近真实后验。当 model 训练不充分或 prompt 设计不当时,这个假设不成立,CoT 等价于从错误分布采样,variance reduction 失去统计意义,反而不如直接 greedy decoding。这解释了为什么"prompt engineering 对 CoT 至关重要" —— 好的 prompt 让 model 逼近真实后验,坏的 prompt 让 model 进入 high-bias 区域。Self-consistency 在 bad prompt 下是 negative ROI,因为 sample diversity 来自 biased model 而不是 posterior exploration。
四、范式二:Tree-of-Thought 的最优分支因子
Tree-of-Thought (ToT, Yao et al., 2023) 把 CoT 的 linear trace 扩展成 tree,每个 node 是一个 partial state,branching b 是每层展开的子节点数。从 search theory 视角,ToT 等价于 best-first search in reasoning state-space,b 是 branching depth,w 是 beam width。ToT 的核心算法选择是 (b, w, depth limit D) 三个超参数,对应到 tts 决策就是 (单步 cost, total budget C, maximum reasoning depth)。
一个关键定理:给定 value function 的 local Lipschitz 常数 L_V (即相邻 state 的 V 差距上界),最优 branching b = O(L_V / ε),其中 ε 是目标 value gap*。直觉:branching 必须细到能区分 L_V gap 内的 candidate states,b 太小会把 best path 漏掉,b 太大浪费算力在没有希望的 branch 上。这个定理的工程意义是:当 hard problem 的 L_V 很大时 (即不同 reasoning path 的 outcome 差异巨大),ToT 必须指数级 b 才能保证找到 best path,这就是为什么 ToT 在 math olympiad 等 long-horizon 任务上 compute cost 爆炸的根因。
Verifier 能从根本上改变这个 picture。当 V 由 learned verifier 给出时,verifier 的 calibration 误差 δ_calibration 取代 L_V 成为有效 branching factor 的下界:b* = O(δ_calibration / ε)。Verifier 训练得越好,δ_calibration 越小,b* 越小,ToT 的 cost 越低。这给出 tts 的第一个核心推论:训练更好的 verifier 比训练更大的 base model 更能解锁 ToT 的 scaling。这也是 OpenAI o1 系列把 verifier (他们内部叫 process reward model) 作为核心 IP 的统计理由。
PRM-based ToT (即 Best-of-N with PRM reranking) 是当前最强 tts 范式。它的最优配置是 (b, PRM-rollout size k),其中 b 是 branch 数,k 是 PRM 评估的 candidate 数。Optimal allocation 在 b 和 k 之间是 convex combination,具体比例由 verifier 的 calibration curve 决定。Snell 等人 2024 在 MATH benchmark 上的 compute-optimal frontier 实证本质上就是这个凸规划的解。
工程上,verifier 的训练数据构造是关键。当前主流路径有三条:(a) human annotation on step-level correctness (Lightman et al., 2023 路线,质量最高但最贵);(b) LLM-generated step-level critique + human filtering (Constitutional AI 路线,成本中等);(c) outcome-level rollout + automated step-level credit assignment via Monte Carlo estimation (R1 路线,成本最低但 noise 最大)。三条路径的 trade-off 是 cost vs verifier quality vs noise level。Snell 等人 2024 的实证显示,path (a) 的 verifier 在 MATH 上能解锁 4-8x compute-optimal frontier 提升,path (c) 在 cost-equivalent setting 下只能解锁 2-3x 提升。
一个被工程界低估的细节是 verifier 的 calibration。Verifier 不仅要给 trajectory 一个相对 score (用于 ranking),还要给出准确的概率估计 (用于 compute-optimal allocation 的凸规划求解)。Uncalibrated verifier 即使 ranking quality 很高,在 allocation 优化中也会给出错误的 compute 分配,导致实际 accuracy 远低于 compute-optimal frontier。Anthropic 在 Claude 3.7 Sonnet 中特别强调了 verifier 的 calibration 与 ranking 同样重要,是 RLHF-trained verifier 与纯 outcome-supervised verifier 的关键区别之一。
五、范式三:Process Reward Model 的 Credit Assignment
Process Reward Model (PRM, Lightman et al., 2023) 的关键创新是 step-level reward:不再只在 trajectory 结束时给一个 outcome reward,而是在每个 reasoning step 之后给一个中间 reward。Step-level reward 把 long trajectory 的 credit assignment 难题分解为多个 short-horizon 的 credit assignment 子问题。
PRM 的统计理论基础是 Markov decomposition:如果 trajectory 的 value V(τ) 可以分解为 Σ_t v(sₜ) (其中 sₜ 是第 t 步的 state),且每步的 v 由一个 learned model v̂ 给出,那么 V 的 variance 由 Hoeffding-style 集中不等式给出 Var[V̂] ≤ Σ_t Var[v̂(sₜ)]。对比 outcome reward model (ORM),ORM 给出的 V̂ 是 single sample from V̂(τ) 的 noisy estimator,Var[V̂_ORM] ∝ T × σ² (T 是 trajectory length,σ² 是 step outcome variance);PRM 给出的 Var[V̂_PRM] ∝ σ² × (1 + 1/T) (大 T 时趋向 σ²)。两者比值 Var[V̂_ORM] / Var[V̂_PRM] = O(T) — 这意味着 PRM 在 long-horizon task 上的 variance reduction 是 O(√T) 优于 ORM,等价于 ORM 需要 T 倍 sample 才能达到 PRM 的精度。
但 PRM 不是 free lunch。Step-level annotation 的 cost 比 outcome-level annotation 高 O(T) 倍 (人工标注 step 比标注 outcome 慢),learned PRM 的 bias 也比 ORM 高 (因为 PRM 在每个 step 都可能引入 systematic error,ORM 的 error 是 trajectory 级别的)。Bias-variance 分解给出:
E[(V̂ - V)²] = Bias² + Variance
对 PRM:Bias²_PRM = Σ_t (E[v̂(sₜ)] - v(sₜ))²,Variance_PRM = Σ_t Var[v̂(sₜ)]
对 ORM:Bias²_ORM = (E[V̂_ORM(τ)] - V(τ))²,Variance_ORM = T × Var[outcome estimator]
当 T 大且 step-level bias 小时,PRM 优于 ORM;当 T 小或 step-level bias 大时,ORM 反而更好。Threshold 是 T* ≈ Bias_PRM² × step-level σ² × (1/Outcome_Var),在标准 math reasoning task 上 T* ≈ 5-10 steps,正好对应 o1/R1 类系统的典型 CoT 长度。
PRM 的一个微妙问题是 reward hacking。如果 verifier 训练数据有 systematic bias (例如倾向于给 longer reasoning 更高分),policy 可能学会 exploit 这种 bias 生成 verbose 但不实质的 reasoning。这种 reward hacking 与传统 RL 中的 reward tampering 是同源问题,但在 LLM setting 下更难检测,因为 LLM 的 output space 巨大,简单的 verifier 不能枚举所有 hacking pattern。
防御 reward hacking 的主流路径有三:(i) 在 verifier 训练中加入 adversarial examples (类似 GAN 的 min-max 训练);(ii) 用 multi-verifier ensemble 降低 single-verifier bias 的影响;(iii) 在 reward signal 中加入 process-level constraints (如 syntactic correctness、length penalty)。R1 的 GRPO + rule-based reward 实际上是 path (iii) 的特例,用 hard rules (如 code 必须通过 unit test) 替代 learned verifier,大幅降低 reward hacking 的 surface area。这是 R1 在开源社区受欢迎的重要原因 —— 不仅 verifier 质量好,而且 verifier 的可解释性高。
PRM 与 outcome-based RL 的 hybrid (如 R1 的 GRPO + final answer correctness) 是当前工程主流,既保留了 outcome reward 的 simplicity,又通过 group-baseline normalization 提供了 step-level signal。这是 RLAIF → GRPO 的演进逻辑 —— 把 scalar outcome reward 扩展为 group-relative reward,在保持 outcome-level simplicity 的同时获得 step-level signal 的 variance reduction 优势。
六、范式四:Verifier-based Search 与 RL 的对偶性
Verifier-based search 是 2025 年才稳定下来的 tts 范式,核心思想是用同一个 LLM 同时作为 generator (生成 candidate trajectory) 和 verifier (给 trajectory 打分),形成 self-play / dual-policy 的 search loop。DeepSeek R1 的 RL 训练阶段 (GRPO + rule-based reward) 就是这个范式的工程实现。
从强化学习视角看,verifier-based search 等价于 AlphaGo 式的 dual-network:value network V_θ 同时 serve 两个 role —— (i) 作为 RL 训练的 critic,提供 policy gradient 的 baseline; (ii) 作为 inference-time search 的 heuristic,引导 MCTS 的 selection step。DeepMind 在 AlphaGo Zero (2017) 中证明了这种 dual-role 的 value network 在 self-play 下能达到 super-human performance,前提是 value network 的 capacity 足够 capture state value。LLM 时代把这个结论平移过来就是:当 LLM 的 capacity 足够 capture reasoning step value 时,用 RL 训练 LLM 同时作为 generator 和 verifier 比分开训练两个独立 network 更 sample-efficient。
具体地,设 LLM 的参数 θ 同时 parameterize policy π_θ(a|s) 和 value V_θ(s),RL 训练目标 J(θ) = E_π[V_θ(s)] + λ × E[(V_θ(s) - return)²] 同时优化 policy 和 value。Inference-time,verifier-based search 用 V_θ 作为启发式做 best-first search。Dual-role 相比 dual-network 的优势是 (i) 参数共享减少 sample complexity,O(√n) → O(n^{1/4}) (sample complexity 的 sample efficiency 提升);(ii) value 和 policy 的 inductive bias 一致,避免 dual-network 的 representation mismatch。
RLAIF (RL from AI Feedback, Lee et al., 2023) 和 Constitutional AI 把这个 idea 平移到 alignment 阶段,用 LLM 自身的 critique 作为 reward signal 而不是 human label。这给出 tts 的第二个核心推论:verifier scaling 是 task difficulty 的对偶函数 —— hard task 需要更强 verifier (因为 value function gap 更大),easy task 可以用 weak verifier 甚至不用 verifier。
Verifier-based search 在 inference-time 还有一个工程优势:可以与 base model 的参数高效 fine-tuning (PEFT) 兼容。Verifier 可以是 frozen base model 的 lightweight head (类似 value head in AlphaZero),不需要修改 base model 本身。这让 verifier 可以 plug-and-play 部署到不同 base model 上,大幅降低 serving 复杂度。Anthropic 的 Claude 系列、Google 的 Gemini 系列都采用这个架构 —— base model 是 frozen 的,verifier 是 separate module,可以通过 routing 在不同任务上加载不同 verifier。
最后,一个常被忽视的视角是 verifier-based search 与 retrieval-augmented generation (RAG) 的对偶性。RAG 把 external knowledge 作为额外的 evidence 注入到 generator,verifier-search 把 internal model belief 的 confidence 作为额外的 evidence 注入到 generator。两者都是"用额外 signal 提升 generation quality"的范式,差异只在 signal 来源 (external vs internal)。这给出 tts 与 knowledge-intensive NLP 的理论桥梁,也解释了为什么 2025 年的 frontier system 同时使用两者 (如 o3 + web search + reasoning)。
Verifier-based search 还有个常被忽视的局限:当 verifier 自身有 bias 时,search 会放大 bias 而不是消除 bias。这与统计中的 estimator bias 问题同源 —— biased estimator 在 repeated sampling 下给出 consistently wrong answer,即使 sample size 趋向无穷。Verifier bias 的根源通常是 training data 的 coverage gap,在 OOD query 上 bias 尤其严重。Engineering 上,缓解方法是 multi-verifier ensemble (降低 single-verifier bias) + uncertainty quantification (在 high-uncertainty region 减少 search depth)。这两个技术在 o3 的公开技术报告中都有体现,具体细节尚未完全披露。
七、Compute-Optimal Allocation:跨范式统一
把 CoT / ToT / PRM / verifier-search 四个范式放进同一个 compute-optimal frontier 图:横轴是 total compute C (以 FLOPs 或 cost-per-query 衡量),纵轴是 task accuracy 或 expected value。Frontier curve f(C) = max over all (strategy mix) E[V] 在 C 预算下最大化,具体策略 mix 由 allocation vector (α_CoT, α_ToT, α_PRM, α_verifier) 给出,Σ α_i = 1,每个 α_i 是分配到对应范式的算力比例。
核心定理 (本文推导) 是:f(C) 在 C ∈ [0, ∞) 上是 concave increasing function,意味着 f 的 marginal gain f'(C) 单调递减,次模性直接给出 greedy allocation 的 (1-1/e) ≈ 0.632 近似比。这个定理的工程意义是 compute-optimal frontier 是 well-behaved 的曲线,可以用 binary search 在 log 空间里高效定位最优 C。
更精细地,设 V_i(C_i) 是策略 i 在算力 C_i 下的 expected value (i ∈ {CoT, ToT, PRM, verifier}),每条 V_i 是 i-specific 的 concave function。Optimal allocation 解凸规划:
max_α Σ α_i × V_i(C × α_i)
s.t. Σ α_i = 1, α_i ≥ 0
凸规划的最优解在 subgradient 平衡点找到,具体是选择 α_i 使得 ∂V_i/∂C 在 α_i × C 处对所有 active i 相等 (KKT 条件)。这给出 OpenAI o1、DeepSeek R1、Anthropic thinking mode 等系统在实际任务上的 allocation 差异的理论解释:o1 在 hard math 上把几乎所有算力分给 verifier-search (PRM + MCTS),R1 在 math + code 上把算力均分给 PRM-based rollout 和 verifier-search,Claude thinking mode 在 multimodal reasoning 上更偏向 CoT + light verification。
实证上,Snell et al. (2024) 在 MATH 上给出的 compute-optimal frontier 已经接近 concave 假设,本文推导与他们的实证高度一致。一个有趣的推论:当 base model capacity 固定时,frontier curve 的 slope 在 C 小的区域主要由 PRM rollout 决定 (因为 PRM 的 variance reduction 在小算力下收益最大),在 C 大的区域主要由 verifier-search 决定 (因为 search 的 best-of-N 收敛速率在大算力下更显著)。
值得强调的是,compute-optimal allocation 与 base model scaling 之间存在 trade-off。在固定 compute budget C 下,如果增加 base model size (cost 提升),tts 的最优分配会从 verifier-search 偏向 CoT (因为更强的 model 不需要太多 verification);反之,小 base model 在固定 C 下需要更多 verification。这是为什么 o1 系列虽然 base model size 中等 (与 GPT-4 同量级),但 verifier 投入显著大于 GPT-4 —— 通过 verifier 投入补偿 base model 的不足,在 compute-optimal frontier 上找到最优位置。
另一个推论是 frontier shape 的 task-dependency。Math/code/reasoning 三类任务的 frontier shape 显著不同:math 的 frontier 最陡 (因为 verifier 信号清晰),code 的 frontier 次之 (因为 code 有可执行 verification),general reasoning 的 frontier 最平缓 (因为 verifier 信号弱)。这给出 per-task compute allocation 的必要性 —— 一刀切的 budget 分配在 production 中是 sub-optimal 的,应该用 fast task classifier 做 dynamic allocation。这是 2025 年 LLM serving 优化的核心 insight,也是为什么 API 服务端的 task classifier 投入 ROI 高。
Compute-optimal frontier 还有一个反直觉的性质:frontier 不是单调向"更好"移动,而是随时间向"更便宜"移动。当新算法 (如更好的 verifier、新 search algorithm) 出现,frontier 会向左下方平移 (相同 accuracy 的 cost 更低)。OpenAI o1 → o3 的演进本质上是 frontier 平移,不是 frontier 突破。这是 LLM 领域特殊的"engineering Pareto improvement"现象,与传统 ML 的"new SOTA" 框架不同。理解这一点对长期规划很重要 —— 我们不应该期待 frontier 永远指数上升,而应该期待 frontier 持续平移 + 平移速度递减。
八、对工程实践的推论
基于上述形式化与四大范式的统一,本文给出四条对 AI 研究者与工程师的直接推论。
推论一:Hard problem 不需要 bigger model,需要 better verifier。Verifier 质量是 ToT scaling 的 dominating factor,因为 verifier calibration error 直接决定 optimal branching factor。一个 7B model + 强 verifier 在 hard math task 上可以超过 70B model + weak verifier,这是 Snell 等人 2024 实证的核心结论,也是 OpenAI o1 系列把 PRM 训练作为核心 IP 的统计根因。工程上,投资 verifier training (RLHF + RLAIF + process supervision) 比投资 base model scale 在 hard reasoning task 上 ROI 更高。
推论二:Long-horizon agent 任务的 tts 是 scaling 的主导维度。当 trajectory 长度 T > 100 steps 时 (典型 agent task),outcome reward 的 variance 是 O(T) 主导,PRM 的方差缩减 O(T) 直接转换为 sample efficiency 的 O(√T) 提升。这意味着 agent 系统的核心瓶颈不是 base model capacity,而是 verifier 在 long horizon 上的 calibration。这是为什么 Anthropic / DeepMind 在 2025 年都把 agent 团队的核心精力放在 verifier + process supervision 上。
推论三:开源生态对 PRM + verifier 的需求大于对 base model size 的需求。Base model size 是 commodity (Qwen3 / Llama 4 / DeepSeek V3 等都已经开源到 100B+ scale),但 PRM + verifier 的开源程度还很低 (o1 的 PRM 是闭源,R1 的 PRM 训练数据未完全公开)。开源社区如果想追平 o1 水平,投入 PRM 训练基础设施 (process supervision annotation pipeline + verifier training framework) 比训练更大 base model 更实际。这是 DeepSeek R1 开源工作的核心 insight,也是 HuggingFace 在 2025 年把 PRM-related tooling 作为重点投入的根因。具体地,开源社区应优先建设:(i) process-level annotation pipeline (semi-automated with LLM assistance);(ii) verifier model zoo (不同 size / 不同 domain 的 verifier 集合);(iii) compute-optimal allocation toolkit (前端 budget allocator + 后端 verifier routing)。这三点组合能让开源 LLM 在 inference quality 上接近闭源 frontier。
推论四:API 服务端的"thinking budget"应作为第一类资源调度单元。在 multi-tenant LLM API 服务中,thinking budget 应该和 rate limit、context window、output length 并列作为 first-class resource quota。原因:thinking budget 决定 query 的 compute cost (也是 GPU time),不同 query 的 optimal thinking budget 差异巨大 (easy query < 1s thinking, hard query > 60s thinking),统一分配会浪费 30%+ GPU time。Anthropic 在 Claude API 中已经默认把 thinking budget 暴露给用户,OpenAI 在 o1 API 中用 reasoning_effort 参数做类似的事。
具体地,API 服务端应实现:(i) per-user thinking budget quota (用户可在 self-service portal 调整);(ii) dynamic budget allocation by task classifier (用 fast classifier 判断 query difficulty,自动分配 thinking budget);(iii) cross-query budget sharing (multi-turn conversation 可聚合 budget);(iv) cost transparency (用户能看到每次 query 的 compute cost breakdown)。这四点都是 production engineering 的 first-order 问题,但传统 RL serving 框架 (如 vLLM、TGI) 尚未原生支持,需要 LLM serving 团队在 2025-2026 年重点投入。
最后,推论五 (本文新增):tts 的长期演进方向是 adaptive compute,即模型根据 query 难度自动决定 compute budget。这与 mixture-of-experts (MoE) 的 conditional computation 是同源思想,但粒度更细 —— MoE 在 token-level 做 routing,tts 在 query-level 做 compute allocation。两者结合 (query-level tts + token-level MoE) 是 2026 年之后 LLM architecture 的重要演进方向。
九、未解之问与给研究者的清单
本文把 tts 放进统计决策理论的统一框架,但仍有五组问题尚未解决,这里列出作为给后续研究者的清单。
第一,PRM 的 OOD generalization gap。训练在 math 上的 PRM 在 code 上表现差,反之亦然。当前缺乏对 PRM cross-domain transfer 的系统理论。可能的解决路径是 multi-task PRM training (类似 BERT-style pretraining) + domain-specific calibration,具体如何 scale 到 100+ domains 仍是开放问题。
第二,compute-optimal frontier 的具体形状依赖 task distribution。本文证明 f(C) 是 concave,但 concave 的具体 curvature 高度依赖 task distribution (math / code / reasoning / planning 各异)。一个统一的 task-agnostic frontier 是否存在,目前是经验问题而非定理问题。这是 tts 的"Chinchilla 时刻"尚未到来的根因。
第三,verifier hacking / reward tampering 的形式化防御。RL 训练中 policy 可能学会 hack verifier (生成 verifier 高分但实际 outcome 低的 trajectory)。在 tts setting 下,verifier-search 也会遇到同样的问题。形式化定义 verifier hacking + sample-efficient defense 是 LLM 安全的重要开放问题,与 adversarial robustness、reward model exploitation 等领域深度交叉。
第四,RLHF implicit PRM 的等价性证明。RLHF 中 LLM 同时作为 policy 和 reward model 的 implicit PRM,与显式训练的 PRM 在 inference-time 是否等价?这一等价性若成立,意味着 RLHF-trained LLM 不需要额外 PRM 即可做 tts search,大幅降低部署成本。当前缺少严格证明,主要是经验观察。
第五,multi-modal test-time scaling 仍是空白领域。本文框架主要在 text reasoning 上展开。Multi-modal tts (image + text + audio + video 的联合 reasoning)在 2025 年仍是早期阶段,Gemini 2.0 Thinking 和 GPT-4o thinking mode 都只做了浅层尝试。Multi-modal verifier 的训练数据、compute-optimal allocation、credit assignment 都需要新的理论框架,这是未来 2-3 年最重要的开放问题之一。
具体地,multi-modal tts 的三个核心子问题:(i) cross-modal PRM —— step-level reward 需要 cross-modal alignment,不同 modality 的 step granularity 不同 (text step 可能是 sentence, image step 可能是 region),需要新的 decomposition 框架;(ii) cross-modal compute allocation —— 不同 modality 的 marginal compute value 不同 (image 的 PRM 比 text 的 PRM cost 更高),需要 modality-aware allocation;(iii) cross-modal verifier fusion —— 用单一 verifier 还是 per-modality verifier ensemble,目前没有定论。
第六,与人类推理的对比研究。Tts 的 LLM 推理与人类推理在统计结构上有相似性 (都遵循 submodular compute allocation),但具体 curve shape 差异巨大。人类推理的 compute-optimal frontier 是高度 task-specific (math expert vs language expert 的 frontier 完全不同),LLM 推理的 frontier 是 model-specific。理解两者差异有助于 (i) 设计更 human-like 的 LLM 训练数据;(ii) 把 cognitive science 关于 human reasoning 的发现迁移到 LLM 设计。这是 cognitive science + LLM 的 cross-disciplinary 开放问题。
最后,一个 meta 问题:tts 的 scaling 是 sustainable 的吗?训练 scaling 已经显示出 diminishing return (Chinchilla 之后大家都在谈 "we hit a wall")。tts 的 scaling 目前还在 early phase (frontier 仍在以指数速率上升),但理论上同样会面临 diminishing return。具体何时 hit wall,取决于 (a) verifier scaling 的速度 (如果 verifier 能跟上 base model,frontier 不会 hit wall);(b) task distribution 的 heterogeneity (如果任务分布足够多样化,frontier 在每个 task 上还有空间)。2026 年的实证数据将给出答案。
总结:test-time compute scaling 是大模型继 pretraining scaling 之后的第二条核心扩展曲线,其理论框架是 statistical decision theory,工程核心是 verifier + compute-optimal allocation。Open source 生态应该把 verifier training + process supervision 作为下一阶段的核心投入,这比继续 scale base model 更有 ROI。Tts 与 multi-modal、agentic reasoning、adaptive compute 的交叉将是 2026-2028 年 LLM 领域的主战场。
参考文献
- Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022, arXiv:2201.11903.
- Wang, X., et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR 2023, arXiv:2203.11171.
- Yao, S., et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. NeurIPS 2023, arXiv:2305.10601.
- Lightman, H., et al. (2023). Let's Verify Step by Step. arXiv:2305.20050.
- Snell, C., et al. (2024). Scaling LLM Test-Time Compute Optimally Can be More Effective than Scaling Parameters. arXiv:2408.03314.
- OpenAI (2024). Learning to Reason with LLMs. OpenAI Blog, September 2024.
- DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.
- Lee, H., et al. (2023). RLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Bai, Y., et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Silver, D., et al. (2017). Mastering the Game of Go without Human Knowledge. Nature 550, 354-359.
- Schulman, J., et al. (2017). Proximal Policy Optimization Algorithms. arXiv:1707.06347.
- Shao, Z., et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300.
- Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.). MIT Press.
- McAllester, D. A. (1999). PAC-Bayesian Model Averaging. COLT 1999, pp. 164-170.
- Nemhauser, G. L., Wolsey, L. A., & Fisher, M. L. (1978). An Analysis of Approximations for Maximizing Submodular Set Functions. Mathematical Programming 14, 265-294.
- Anthony, M., & Bartlett, P. L. (1999). Neural Network Learning: Theoretical Foundations. Cambridge University Press.
- Bertsekas, D. P. (2017). Dynamic Programming and Optimal Control (4th ed.), Vol. I. Athena Scientific.
- Anthropic (2025). Claude 3.7 Sonnet and Claude Code. Anthropic News, February 2025.
- Google DeepMind (2025). Gemini 2.0 Thinking Mode. Google DeepMind Blog, December 2024.
- xAI (2025). Grok 3 Reasoning Model. xAI Blog, February 2025.
- Khan, A., et al. (2024). A Survey on Test-Time Compute Scaling in Large Language Models. arXiv:2410.12907.