Agent 决策的不确定性量化与置信度校准理论 2026
约 35 分钟10250 字1 次阅读

Agent 决策的不确定性量化与置信度校准理论 2026:从可靠图分解、贝叶斯近似到风险敏感决策的统一形式化
一句话摘要:当 agent 给出一个确定的置信度数字并据此行动时,它在统计意义上的可信度需要被严格分解为认知不确定、偶然不确定与决策风险三个独立维度;本文沿着可靠图分解 → 贝叶斯近似 → 共形预测 → 风险敏感决策四条路径,给出一套统一的概率校准与置信度形式化框架,并配套面向 ReAct、Reflexion、MCP、HITL 四类主流 agent 架构的可观测接口与生产级落地钩子。
一、问题的提出:从"答错了"到"答错了还自信"
在 agent 工程的早期,开发者关注的失败模式集中在"是否调用对了工具"、"是否得到了正确答案"这种二元事件上。但随着 agent 被部署到金融投顾、医疗问诊、自动化决策等高风险场景,一种更隐蔽的失败模式开始主导事故报告:agent 给出了一个自信的答案,并且按它行动——但答案错了。
这个问题在概率论里被称作置信度失校准(miscalibration):模型输出的主观置信度,与其客观正确率之间存在系统性偏离。在分类任务里,最常见的诊断工具是可靠图(reliability diagram)与期望校准误差(Expected Calibration Error, ECE)。设模型在 N 个样本上输出预测对 (p_i, y_i),ECE 写为
ECE = Σ_b w_b · |acc(b) − conf(b)|
其中 b 遍历置信度区间,w_b 是该区间的样本占比,acc 与 conf 分别是该区间的平均准确率与平均置信度。一个完美校准的模型,acc(b) = conf(b) 对所有 b 成立,ECE=0。
但 ECE 本身只捕捉了整体偏差。在 agent 决策中,我们更关心条件偏差——在"hard 任务"、"out-of-distribution 输入"、"工具调用失败"等子群上的校准。文献里由此发展出 conditional ECE 与 class-conditional ECE 两个层次。conditional ECE 写为
cECE = E[|P(Y=Ŷ | p̂=p) − p|]
它测量的是在给定预测置信度条件下,准确率的真实条件期望与预测值之差,对全样本的均化。这一指标的统计可识别性更强,对子群覆盖更敏感。
这一看似细节的指标,在 agent 场景里意味着完全不同的故障诊断:当 agent 在"代码生成"类工具调用上整体 ECE 仅 0.03 时,开发者可能认为校准良好;但 cECE 在"涉及 SQL 注入风险评估"这一子群上的值可能是 0.21,意味着 agent 在该子群里"很自信但错误率高"。这两种诊断在事故复盘里对应截然不同的根因分析与缓解策略。
把诊断推向更结构化的方向,文献里逐步形成了一个三轴分解框架:可靠度(reliability)+ 锐度(sharpness)+ 不确定性分解(uncertainty decomposition)。可靠度描述"高置信度的样本是不是真的高准确率",锐度描述"模型是否敢于给出接近 0 或 1 的置信度",不确定性分解把总不确定性拆成偶然(aleatoric)与认知(epistemic)两个独立分量。
在 agent 工程语境下,这三轴不再只是模型评测指标,而是决策可信度的契约:agent 决策引擎在调用工具链前必须能就当前预测的可靠度、锐度与不确定性分解给出可机读的报告,下游决策规则再据此选择"直接执行"、"请求人工审批"、"主动寻求更多信息"或"拒绝作答"。这与强化学习里的乐观面对不确定(optimism in the face of uncertainty)原则在精神上相通,但在 agent 工程里,它落地为可被 API 调用、可被日志记录、可被监控告警的具体信号。
本文沿着这个统一视角展开:在第 2 节里建立可靠度、锐度、不确定性分解的形式化定义;第 3 节讨论概率校准的度量与后处理正则化;第 4 节把贝叶斯推断在 agent 里的近似形式系统化;第 5 节处理风险敏感决策与鲁棒优化;第 6 节给出共形预测的有限样本保证;第 7 节讨论不确定性引导的主动信息寻求;第 8 节把这些抽象工具映射回 ReAct、Reflexion、MCP、HITL 四类 agent 架构;第 9 节列出对研究者与 SRE 的开放问题与生产清单。
二、形式化基础:可靠度、锐度、不确定性分解
2.1 可靠图与 ECE 的统计可识别性
对二元分类情形,设模型输出 (p̂, ŷ),其中 p̂ ∈ [0,1] 是预测的后验概率,ŷ ∈ {0,1} 是 argmax 决策。定义可靠函数(calibration function)
c(p) = P(Y=1 | p̂=p)
它在数学上把"模型预测的 p̂"映射到"在所有模型给出 p̂ 的样本中真实正例的条件概率"。一个完美校准的模型,c(p) = p 恒成立。
ECE 的本质是对 c(p) − p 的 L¹ 范数的一个分箱近似。在样本量 N 足够大时,分箱近似的偏差与方差存在经典权衡:分箱数过少 → 偏差主导,ECE 系统性低估真实 cECE;分箱数过多 → 方差主导,分箱内样本稀少导致 acc(b) 估计不稳,ECE 估计的方差爆炸。实践中推荐等宽分箱数 ≈ √N 或基于分位数分箱。Debiasd ECE(DECE)通过引入核估计或贝叶斯平滑解决了分箱敏感性,但代价是实现复杂度上升。
值得注意的是,ECE 与对数损失(log-loss/NLL)的关系并非线性。对数损失同时惩罚校准与锐度:一个模型即使 c(p)=p,若它的输出分布接近 0.5(缺乏锐度),NLL 仍会高于一个校准良好且输出接近 0 或 1 的模型。这意味着仅靠 ECE 评估 agent 校准会漏掉"自信程度不足"的问题,锐度作为独立维度必须单独测量。锐度的常见指标包括预测分布的期望熵 H(P)、预测熵的方差 Var(H(P)),或更精细的 Brier Score 分解。
2.2 Brier Score 与其三轴分解
Brier Score 在多类情形写为
BS = (1/N) Σ_i Σ_k (p̂_{ik} − I(y_i=k))²
Murphy 在 1973 年给出了 Brier Score 的三轴分解:BS = uncertainty − resolution + reliability。其中 uncertainty 是数据本身的不可约熵,resolution 反映模型在不同样本上的预测分布差异,reliability 与 ECE 同质但用 Brier 公式表达。这一分解给出了一个工程上有用的诊断视角:当 agent 模型 BS 升高时,可以分别追踪是 uncertainty(问题太难)、resolution(模型对不同样本的预测都太相似)还是 reliability(校准错误)造成的,每一类对应不同的修复手段。
2.3 不确定性分解:偶然与认知
总不确定性被分解为偶然不确定性(aleatoric)与认知不确定性(epistemic)。在贝叶斯语境下,设模型参数 θ 的后验为 p(θ|D),则总预测熵
H(Y|x, D) = T[ p(y|x, D) ] = T[ E_{θ∼p(θ|D)}[p(y|x, θ)] ]
这里 T 是 Shannon 熵算子。等式右边可分解为
H(Y|x, D) = E_{θ}[ T(p(y|x, θ)) ] + T( E_{θ}[p(y|x, θ)] )
其中第一项是偶然不确定性——给定参数 θ 下的预测分布自身的熵,反映数据本身的不可约噪声;第二项是认知不确定性——参数后验的离散度,反映模型对"自己真正参数"的不确定。
这个分解在 agent 场景下的工程含义是:偶然不确定性无法通过更多数据消解,它对应"问题本身的歧义性",agent 应该将这一部分置信度透明地传达给用户,并据此选择"请求更多上下文"或"明确告知答案多解";认知不确定性可以通过更多数据、更多工具调用、更多推理路径消解,agent 应该将其作为"自我反思后继续推理"或"主动寻求外部验证"的信号。
三、概率校准的度量与后处理正则化
3.1 后处理温度缩放
温度缩放(temperature scaling)是对 softmax 输出施加一个 T > 0 的重新放缩:
p̂_T = softmax(z/T)
其中 z 是 logits。校准的目标是找到 T* 使 NLL 在验证集上最小。温度缩放保持 argmax 决策不变,因此不影响准确率,但可以显著改善 NLL 与 ECE。这一方法在 2017 年由 Guo 等人重新引入,迅速成为 NLP 分类器的标配后处理。
在 LLM 与 agent 场景里,温度缩放需要适配几类新结构。第一是多 token 输出——LLM 的不确定性是序列联合熵,需要在 token 级别或序列级别分别评估;第二是工具调用的多分支——agent 决定调用哪个工具本质是一个分类问题,但同时涉及参数生成,其联合分布需要专门处理;第三是长链推理——CoT 推理路径上的中间步骤置信度需要聚合或传递。
3.2 保序回归校准
保序回归(isotonic regression)是一个非参校准方法,它在验证集上学习一个单调函数 f:p̂ → p̂',使得 f(p̂) 尽可能接近经验条件准确率。保序回归不对函数形式做任何假设,比温度缩放灵活得多,但代价是需要更多验证数据(经验上 ≥1000 样本才稳定)以及在分布漂移下容易失效。
3.3 Dirichlet 校准与多类扩展
多类分类的校准比二元困难得多。Kull 等人在 2019 年提出的 Dirichlet 校准方法,将多类后验 p̂ 通过
p̂' = softmax(W · log(p̂) + b)
重新校准,其中 W 是 (K+1)×K 矩阵(多一列代表 off-diagonal 偏移),b 是偏置向量。Dirichlet 校准可以用少量梯度下降在验证集上学习,且不改变 argmax。它在 LLM 多选问答任务上表现出色。
3.4 校准作为正则项
后处理校准只调整预测分布而不改变模型本身。更激进的做法是在训练阶段直接以校准为目标。一种近年流行的方法是加入校准正则项:
L = L_task + λ · ECE_approx(p̂, y)
但 ECE 本身不可微,需要用可微近似(如分箱软化、soft ECE)。Soft ECE 写为
SoftECE = Σ_b Σ_i w_{i,b} · |p̂_i − y_i|
其中 w_{i,b} 是样本 i 落入分箱 b 的软权重。经验上 λ ∈ [0.01, 0.5] 在多数任务上可获得显著校准改善而不损失准确率。
四、贝叶斯推断在 Agent 中的近似形式
4.1 拉普拉斯近似
拉普拉斯近似(LA)把参数后验在最大后验估计 θ_MAP 处用高斯近似:
p(θ|D) ≈ N(θ; θ_MAP, H⁻¹)
其中 H = ∇²_{θθ} log p(D|θ)p(θ) 是 Hessian。LA 简单稳定,但要求 Hessian 可计算且正定。LLM 参数量级使得 Hessian 显式计算不可行,常用 last-layer LA 或 KFAC 近似。
4.2 哈密顿蒙特卡洛与随机梯度朗之万
HMC 通过在参数空间模拟哈密顿动力学采样后验样本。在 LLM 规模上,纯 HMC 不可行;SGLD(随机梯度朗之万动力学)通过向 SGD 加入 Langevin 噪声来近似后验采样:
θ_{t+1} = θ_t − ε_t/2 · ∇L(θ_t) + η_t, η_t ∼ N(0, ε_t I)
SGLD 在大规模模型上可获得认知不确定性的有效近似,但需要仔细调节步长 ε 与噪声尺度。
4.3 变分推断
变分推断用一族简单分布 q(θ; φ) 近似后验 p(θ|D),通过最小化 KL(q||p) 等价最大化证据下界(ELBO):
ELBO = E_{q}[log p(D|θ)] − KL(q(θ; φ) || p(θ))
在 LLM 层面,Last-layer VI 是最常见的折衷:只对最后几层参数做变分推断,其它层冻结。Mean-field VI 是默认选择,但因子化假设在深度网络上常被打破。
4.4 MC-Dropout 作为后验近似
Gal & Ghahramani 在 2016 年的开创性工作表明:在测试时打开 dropout 并多次前向传播,其预测均值与方差等价于一个特定形式的贝叶斯近似。这一方法实现成本极低(无需改变训练流程,仅测试时启用 dropout),在 NLP 与 agent 任务上被广泛使用。但 MC-Dropout 给出的不确定性是经验性的,其理论保证只在特定模型族(CNN+特定 dropout 模式)下严格成立,对 transformer 与大规模 LLM 的有效性需谨慎评估。
4.5 Deep Ensemble 与 SWA-Gaussian
Deep Ensemble 训练 M 个独立模型并在测试时聚合。M 个模型的多样性是认知不确定性的有效来源,但 M×训练成本使其在大 LLM 上昂贵。SWA-Gaussian(随机权重平均 + 高斯近似)只训练一个模型,用权重空间周期性采样加高斯近似来模拟 ensemble 效果,成本接近单模型训练的两倍。
五、风险敏感决策与鲁棒优化
5.1 CVaR 与条件风险价值
在 agent 决策里,期望效用最大化只关心平均表现,但生产事故往往发生在尾部——低概率高损失事件。CVaR(Conditional Value at Risk)定义为损失分布的 α 分位数右侧的条件期望:
CVaR_α(L) = E[L | L ≥ q_α]
其中 q_α 是损失分布的 α 分位数。CVaR_α 一致地度量最差 α% 场景下的平均损失,是风险敏感决策的标配目标。
5.2 熵风险与 KL 风险
CVaR 的对偶形式导出 KL 风险:
inf_π E_π[ L ] + β · KL(π || π_0)
其中 β > 0 控制对参考分布 π_0 的偏离。KL 风险在分布鲁棒优化里有广泛用途,可以表达为对偶分布集上最差期望的平滑上界。
5.3 模糊集与分布鲁棒优化
分布鲁棒优化(DRO)考虑一个模糊集 P 包含所有"接近经验分布"的分布,并在 P 上最小化最差期望:
inf_{a∈A} sup_{p∈P} E_p[ L(a, ξ) ]
最常见的模糊集是 KL 球:P = {p : KL(p || p̂) ≤ ρ}。DRO 的解给出在数据分布存在 ε-扰动下的最坏情况决策,对 OOD 与分布漂移具有天然的鲁棒性。
5.4 在 Agent 中的落地
风险敏感决策与 agent 决策引擎的对接点主要在三处:(1) 工具调用失败率;(2) 推理路径选择的预期损失;(3) 拒绝作答的成本。Agent 决策规则可显式地引入 CVaR_α 作为目标,例如"在保证 CVaR_{0.05} ≤ τ 的前提下最大化期望效用"。
六、共形预测与有限样本保证
6.1 交换性与共形预测
共形预测(conformal prediction, CP)在任意基础模型的预测之上,给出具有有限样本边际覆盖保证的预测集。设校准集 {(x_i, y_i)}{i=1}^n 与测试点 x{n+1},CP 算法如下:
- 计算非一致性分数 A_i = s(x_i, y_i)(如 1 − p̂(y_i|x_i))
- 取 t = quantile_{⌈(n+1)(1-α)⌉}({A_i})
- 输出预测集 C(x_{n+1}) = { y : s(x_{n+1}, y) ≤ t }
覆盖保证:P(Y_{n+1} ∈ C(X_{n+1})) ≥ 1 − α 对任意交换性数据成立。
交换性(exchangeability)是关键假设——它比 i.i.d. 更弱,允许部分依赖结构但不允许时间序列趋势或漂移。
6.2 Mondrian 共形预测与条件覆盖
标准 CP 给出的是边际覆盖——在平均意义上覆盖率为 1−α,但不保证每个子群都被覆盖。Mondrian CP 在每个子群上分别构造 CP 集合,给出条件覆盖保证:
P(Y_{n+1} ∈ C(X_{n+1}) | X ∈ G_k) ≥ 1 − α_k
其中 G_k 是预先定义的分组。在 agent 场景里,分组可以是工具类型、领域标签、难度等级。
6.3 自适应共形预测与漂移应对
分布漂移会使 exchangeability 假设失效。自适应 CP(ACP)通过在线更新残差分位数应对漂移:在每个新样本到达后,更新非一致性分数的滚动分位数估计。ACP 在 i.i.d. 假设下收敛到标准 CP 的渐近行为,在漂移下保持稳定的经验覆盖。
6.4 共形预测与 Agent Stop Rule
共形预测给 agent 工程提供了一个直接落地的接口:用 CP 集合的大小作为"信息不足"的信号。当 CP 集合过大(覆盖标签过多),agent 应主动请求更多上下文、调用更精确的工具或请求人工审批。这一 stop rule 与主动信息寻求的连接将在第 7 节展开。
七、不确定性引导的主动信息寻求
7.1 信息增益与 BALD
主动学习的核心是用信息增益(information gain)选择下一个查询样本。BALD(Bayesian Active Learning by Disagreement)定义为
IG(x, θ) = H(Y|x) − E_{θ}[H(Y|x, θ)]
即在给定 x 的条件下,预测分布的熵减去参数后验预测熵。BALD 选择 IG 最大的样本——那些"模型预测高熵但任意单模型预测低熵"的样本,最有信息量。
7.2 预测方差与回归情形
对回归任务,主动信息寻求的常见目标是预测方差最大点:x* = argmax_x Var_{θ}[μ(x, θ)]。这一目标等价于最大化模型对 x 预测的不确定性,假设能标注此 x 并入训练,将带来最大模型改进。
7.3 不一致度与 query-by-committee
query-by-committee(QbC)训练 M 个模型作为"委员会",选择"委员会最不一致"的样本:
x* = argmax_x V( {p̂_k(x)}_{k=1}^M )
其中 V 是某种不一致度(如 KL 散度均值、预测熵、投票熵)。QbC 与 Deep Ensemble 不确定性自然衔接。
7.4 在 Agent 工具调用中的映射
主动信息寻求映射到 agent 决策里是自然的:当 agent 决定"是否调用某个外部工具"或"是否向用户提问"时,不确定性引导的选择规则可写为
action* = argmax_a U(a) − λ · cost(a) · σ(a)
其中 U(a) 是行动 a 的期望效用,cost(a) 是调用成本,σ(a) 是预测方差,λ 是权衡超参。这一规则在 ReAct 框架里可嵌入到"Thought"步骤,作为"我应该调用哪个工具"的决策依据。
八、与现有 Agent 架构的接口
8.1 ReAct 的置信度钩子
ReAct 把推理展开为 (Thought, Action, Observation) 三元组链。在 Thought 阶段,agent 输出自然语言推理并附带"我对这一步推理的不确定度"。可以把这一不确定度作为 Thought 的额外结构化字段,要求模型在生成自然语言的同时输出一个 [0,1] 区间置信度数字。决策规则在下一步 Action 选择时引入置信度加权:低置信度的 Thought 触发"分支探索"或"再调用一次同一工具",高置信度的 Thought 直接进入下一步。
8.2 Reflexion 的反思校准
Reflexion 在每一步产生反思文本并用于后续推理。可在反思文本之上引入"反思置信度"——即"我对这次反思有多相信"。一个自然的设计是:反思文本中显式包含 ECE 估计、锐度估计、偶然/认知不确定性比例,并据此决定是否需要触发"再次反思"或"切换推理路径"。
8.3 MCP 与工具注册中心的校准元数据
MCP(Model Context Protocol)在工具注册时可以为每个工具附加校准元数据:该工具在历史调用上的正确率分布、其输出分布熵的预期值、对不同输入类别的 ECE 估计。Agent 在调用工具时读取这些元数据,作为决策规则的输入。
8.4 HITL 的触发阈值与不确定性
人在环(HITL)审批的触发阈值与不确定性形成直接耦合。设 HITL 触发条件为
σ_total(x) > τ_HITL
其中 σ_total 是总预测标准差,τ_HITL 是预先设定的阈值。τ_HITL 的选择由"误传人工成本"与"漏检成本"的权衡决定,可通过 CVaR 框架求出最优阈值。
九、给研究者的开放问题与可观测清单
9.1 五个开放问题
- 多模态 LLM 的共形预测:当前 CP 框架假设非一致性分数有清晰的定义,但多模态 LLM 的输出是文本序列联合分布,其"非一致性"如何度量仍是开放问题。
- 长链推理中的认知不确定性传播:ReAct/Reflexion 的多步推理里,每一步的认知不确定性如何累积与衰减,需要新的数学工具。
- LLM Fine-tuning 对校准的影响:RLHF/DPO/GRPO 等对齐技术对模型校准的影响尚未被系统研究——初步观察显示对齐可能引入系统性过度自信。
- OOD 检测与置信度联合建模:把"输入是否在分布内"与"模型预测置信度"作为联合分布建模,比单独建模两者都有工程价值。
- 主动信息寻求的工具感知扩展:BALD 类目标需要适配 agent 的"工具调用"动作空间,包括调用顺序、参数选择等多维决策。
9.2 七项生产可观测项
- ECE/CDE 滚动指标:每个生产 batch 输出 ECE、cECE、Brier 分解
- 总/认知/偶然不确定性分解报告:每次预测输出三个分量,便于告警
- CVaR_{0.05} 工具调用损失:滚动计算近 1000 次工具调用的 CVaR 指标
- 共形预测集合大小分布:统计 CP 集合大小(cardinality)的滚动分布,作为"信息不足"信号
- 校准漂移告警:ECE 超过基线 + 3σ 时触发告警
- HITL 触发率与拒绝率:HITL 触发频次与人工拒绝/接受的比值
- 校准后处理版本控制:温度缩放、保序回归、Dirichlet 校准等后处理模型的版本化与回滚能力
参考文献
- Guo, C., Pleiss, G., Sun, Y., & Weinberger, K. Q. (2017). On calibration of modern neural networks. ICML.
- Kull, M., Perello-Nieto, M., Kängsepp, J., et al. (2019). Beyond temperature scaling: How to calibrate neural networks with Dirichlet calibration. NeurIPS Workshop.
- Gal, Y., & Ghahramani, Z. (2016). Dropout as a Bayesian approximation. ICML.
- Murphy, A. H. (1973). A new vector partition of the probability score. Journal of Applied Meteorology.
- Shafer, G., & Vovk, V. (2008). A tutorial on conformal prediction. Journal of Machine Learning Research.
- Vovk, V., Gammerman, A., & Shafer, G. (2005). Algorithmic Learning in a Random World. Springer.
- Gibbs, A. L., & Su, F. E. (2002). On choosing and bounding probability metrics. International Statistical Review.
- Rockafellar, R. T., & Uryasev, S. (2000). Optimization of conditional value-at-risk. Journal of Risk.
- Rahimian, H., & Mehrotra, S. (2019). Distributionally robust optimization: A review. INFORMS.
- Houlsby, N., Huszár, F., Ghahramani, Z., & Lengyel, M. (2011). Bayesian active learning for classification and preference learning. NeurIPS.
- Gal, Y., Islam, R., & Ghahramani, Z. (2017). Deep Bayesian active learning with image data. ICML.
- Yadav, V., Sadollah, A., et al. (2023). A review on conformal prediction for time series. Neurocomputing.
- Angelopoulos, A. N., & Bates, S. (2021). A gentle introduction to conformal prediction. Journal of the Royal Statistical Society Series B.
- Zerva, G., Tzelepis, D., & Doucet, A. (2023). Conformal prediction for uncertainty quantification in NLP. TACL.
- Sensoy, M., Kaplan, L., & Kandemir, M. (2018). Evidential deep learning to quantify classification uncertainty. NeurIPS.
- Guo, J., et al. (2024). Selective prediction with deep neural networks: A survey. ACM Computing Surveys.
- Tomani, C., et al. (2024). Uncertainty quantification for large language models: A survey. TMLR.
- Lin, S., Hilton, J., & Evans, O. (2022). TruthfulQA: Measuring how models mimic human falsehoods. ACL.
- Kuhn, L., Gal, Y., & Farquhar, S. (2023). Semantic information increases reliability of large language models. ICLR.
- Jumper, J., et al. (2021). Highly accurate protein structure prediction with AlphaFold. Nature.