博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

  1. 文章
  2. Agent 工具调用的不确定性量化与 Conformal Prediction 统一理论 2026

Agent 工具调用的不确定性量化与 Conformal Prediction 统一理论 2026

2026年8月24日·约 42 分钟·12361 字·0 次阅读
Agent 技术
Agent 工具调用的不确定性量化与 Conformal Prediction 统一理论 2026

目录

  • 一、问题的提出:为什么工具调用需要不确定性理论
  • 二、形式化:epistemic-aleatoric 分解与选择熵
  • 三、ReAct 范式下的不确定性传播与循环放大
  • 四、Toolformer 风格的监督校准:Brier、ECE 与温度缩放
  • 五、Conformal Prediction 在工具选择中的覆盖率保证
  • 六、选择熵与拒答机制:从 selective prediction 到 abstain
  • 七、对工程实践的推论:4 条可执行项
  • 八、与现有方法的关系与局限
  • 九、给研究者的展望
  • 参考文献

Agent 工具调用的不确定性量化与 Conformal Prediction 统一理论 2026

一句话摘要:把工具选择视为一个受不确定性驱动的决策过程,用 epistemic-aleatoric 分解 + 选择熵形式化工具调用的失败模式,再以 Conformal Prediction 给出工程可部署的有限样本覆盖率保证,最终在拒答机制上把"知道自己不知道"变成可观测、可计费、可工程化的能力。

一、问题的提出:为什么工具调用需要不确定性理论

过去两年,大模型驱动的智能体(Agent)从对话系统跃迁为可在生产环境执行真实操作的执行者。OpenAI 的 Function Calling、Anthropic 的 Tool Use、Google 的 Vertex AI Extensions,以及开源生态中的 LangChain、LlamaIndex、CrewAI、AutoGen,几乎都把"工具调用(tool calling)"视为 Agent 的核心交互原语。在工具调用从研究演示走向生产部署的过程中,工程团队陆续观察到一组反复出现、彼此纠缠的失败模式:模型声称调用了一个不存在的工具、模型对工具参数给出语法正确但语义错误的填充、模型在多个候选工具之间反复跳变、模型在自评置信度较高时仍然返回错误结果、以及在缺乏合适工具时仍然强行选择一个最接近的工具并给出看似合理的解释。这些失败并非孤立的工程 bug,它们背后隐含一个统一的现象:当前工具调用决策缺乏对自身不确定性的量化能力。

从工程角度看,工具调用本质上是一个受约束的决策问题:给定自然语言指令 xxx 与可用工具集 T={t1,…,tK}\mathcal{T} = \{t_1, \dots, t_K\}T={t1​,…,tK​},模型需要从 T\mathcal{T}T 中选择一个或多个工具 t∗=arg⁡max⁡tP(t∣x,T)t^* = \arg\max_t P(t \mid x, \mathcal{T})t∗=argmaxt​P(t∣x,T),并为所选工具的参数生成 θ\thetaθ。传统做法把这个决策建模为单一的 softmax 概率分布,并以 argmax 直接执行——这种"贪心-单峰"假设掩盖了两个本质困难:(1)模型对自身预测的置信度往往被系统性高估,softmax 概率与真实正确率之间存在巨大鸿沟;(2)工具集 T\mathcal{T}T 是动态变化的,新工具的引入、旧工具的废弃、工具 schema 的演进都会让历史校准失效。这两个困难在生产环境中被进一步放大:当工具调用的下游连接数据库、支付系统、生产部署接口时,"看起来合理但语义错误"的参数比"明确拒绝调用"更危险,因为它会触发真实的副作用。

把不确定性显式纳入决策的理论框架,在统计学与机器学习领域已有近 30 年研究历史。Conformal Prediction、Bayesian Model Combination、Selective Prediction、Calibration 等方法各自发展出了成熟的数学工具。本文的目标是把这些理论工具系统地移植到 Agent 工具调用场景,并论证这一移植不仅是概念上的类比,而是由工具调用的本质结构所决定:(a) 工具调用的标签空间是有限离散的(K 个候选工具 + abstain),天然适合 Conformal Prediction 的离散假设;(b) 工具调用的校准集容易获得(人工标注的工具选择对、真实执行的成功/失败日志),天然适合 recalibration;(c) 工具调用的代价是异质的(有的工具只读、有的工具修改数据库、有的工具调用支付接口),天然适合 cost-sensitive selective prediction;(d) 工具调用通常是 Agent 决策链的中间节点,前一步的不确定性会向后传播,天然适合 epistemic-aleatoric 分解。

基于上述观察,本文提出一个统一的不确定性量化框架,用以覆盖工具调用从决策、执行到拒答的完整生命周期。框架的核心由四个数学对象构成:epistemic-aleatoric 分解、选择熵(choice entropy)、Conformal 覆盖率保证、cost-aware 拒答阈值。这四个对象分别回答四个问题:(i) 模型不确定的根源是数据不足还是问题本身固有?(ii) 模型对各候选工具的偏好有多分散?(iii) 给定有限校准集,预测集合能在多大程度上覆盖真实正确工具?(iv) 在异质代价下,模型应该在何时选择拒答而非冒险执行?

二、形式化:epistemic-aleatoric 分解与选择熵

在工具调用决策中,不确定性可被分解为两个本质不同的成分。Aleatoric 不确定性(数据不确定性)由任务本身的多义性、工具 schema 的歧义、用户指令的模糊性等因素决定,即使拥有无限数据也无法消除;Epistemic 不确定性(模型不确定性)则源于训练数据的有限性与模型表达能力的局限,理论上随数据量增加而趋于零。区分这两者对工程实践至关重要:aleatoric 不确定性高的任务应该被转人工(humans in the loop),而 epistemic 不确定性高的任务则可通过收集执行反馈、扩充训练数据来降低。

在工具调用场景下,epistemic-aleatoric 分解可以通过 ensemble disagreement 或 mutual information 估计。设模型对工具 ttt 的预测分布为 Pθ(t∣x)P_\theta(t \mid x)Pθ​(t∣x),其中 θ\thetaθ 为模型参数。给定 MMM 个独立训练的模型 {θ1,…,θM}\{\theta_1, \dots, \theta_M\}{θ1​,…,θM​},epistemic 不确定性可量化为预测分布之间的平均分歧:

Uepi(x)=1M∑m=1MDKL(Pθm(t∣x)∥Pˉ(t∣x))\mathcal{U}_{\text{epi}}(x) = \frac{1}{M} \sum_{m=1}^{M} D_{\text{KL}}(P_{\theta_m}(t \mid x) \| \bar{P}(t \mid x))Uepi​(x)=M1​∑m=1M​DKL​(Pθm​​(t∣x)∥Pˉ(t∣x))

其中 Pˉ(t∣x)=1M∑mPθm(t∣x)\bar{P}(t \mid x) = \frac{1}{M} \sum_m P_{\theta_m}(t \mid x)Pˉ(t∣x)=M1​∑m​Pθm​​(t∣x)。aleatoric 不确定性则可量化为预测分布的平均熵:

Uale(x)=1M∑m=1MH(Pθm(t∣x))=−1M∑m=1M∑t∈TPθm(t∣x)log⁡Pθm(t∣x)\mathcal{U}_{\text{ale}}(x) = \frac{1}{M} \sum_{m=1}^{M} H(P_{\theta_m}(t \mid x)) = -\frac{1}{M} \sum_{m=1}^{M} \sum_{t \in \mathcal{T}} P_{\theta_m}(t \mid x) \log P_{\theta_m}(t \mid x)Uale​(x)=M1​∑m=1M​H(Pθm​​(t∣x))=−M1​∑m=1M​∑t∈T​Pθm​​(t∣x)logPθm​​(t∣x)

总不确定性满足 Utotal(x)=Uepi(x)+Uale(x)\mathcal{U}_{\text{total}}(x) = \mathcal{U}_{\text{epi}}(x) + \mathcal{U}_{\text{ale}}(x)Utotal​(x)=Uepi​(x)+Uale​(x),这是 mutual information 分解的经典结论。对工具调用而言,这一分解的工程意义在于:当 Uale\mathcal{U}_{\text{ale}}Uale​ 主导时,即使收集更多执行反馈也难以显著降低错误率,应该直接拒答或转人工;当 Uepi\mathcal{U}_{\text{epi}}Uepi​ 主导时,可通过主动收集相似指令的工具选择标签来降低不确定性。

选择熵(choice entropy)是另一个对工具调用至关重要的量。给定预测分布 P(t∣x)P(t \mid x)P(t∣x),选择熵定义为:

Hchoice(x)=−∑t∈TP(t∣x)log⁡P(t∣x)\mathcal{H}_{\text{choice}}(x) = -\sum_{t \in \mathcal{T}} P(t \mid x) \log P(t \mid x)Hchoice​(x)=−∑t∈T​P(t∣x)logP(t∣x)

与 aleatoric 不确定性不同,选择熵度量的是模型对各候选工具的偏好分散程度,是一个更接近决策面(decision surface)的量。当 Hchoice(x)\mathcal{H}_{\text{choice}}(x)Hchoice​(x) 接近 0 时,模型强烈倾向于某一个工具;当 Hchoice(x)\mathcal{H}_{\text{choice}}(x)Hchoice​(x) 接近 log⁡K\log KlogK 时,模型在所有工具间几乎无偏好。选择熵是 Conformal Prediction 中构造预测集合(prediction set)的天然输入:选择熵越高,预测集合应越大;选择熵越低,预测集合可收紧到单元素。

在工程实现中,epistemic-aleatoric 分解与选择熵并非相互独立,而是互补的两个视角。前者刻画不确定性的根源(数据 vs 模型),后者刻画不确定性在决策面上的形状(尖峰 vs 平坦)。两者结合可构造一个二维的风险画像:横轴是选择熵(决策分散度),纵轴是 epistemic 不确定性(模型置信度)。这个二维画像可直接用于工程路由:低选择熵 + 低 epistemic → 高置信度 → 直接执行;高选择熵 + 高 epistemic → 高风险 → 拒答或转人工;低选择熵 + 高 epistemic → 模型有强烈偏好但偏好本身不可靠 → 触发人工审核;高选择熵 + 低 epistemic → 决策面平坦但原因清楚 → 用 Conformal Prediction 给出预测集合而非单点决策。

三、ReAct 范式下的不确定性传播与循环放大

ReAct(Reason + Act)是当前最主流的 Agent 推理范式之一,它把工具调用嵌入到 Thought-Action-Observation 的循环中。每一轮 ReAct 包含三个步骤:(1) 模型基于当前状态生成 Thought(推理);(2) 基于 Thought 生成 Action(工具调用);(3) 接收 Observation(工具返回结果)并更新状态。ReAct 的优雅之处在于把"思考"与"行动"耦合在同一个推理轨迹中,模型可以在调用工具前先推理、调用工具后再反思。

但 ReAct 的循环结构带来了一个独特的工程问题:不确定性在循环中被反复放大。设第 iii 轮的工具调用决策的不确定性为 Ui\mathcal{U}_iUi​,下游观察结果为 oio_ioi​,下一轮的输入为 xi+1=f(xi,oi)x_{i+1} = f(x_i, o_i)xi+1​=f(xi​,oi​)。若 fff 是有损的(如截断、压缩、摘要),则 I(xi+1;t∗)≤I(xi;t∗)I(x_{i+1}; t^*) \leq I(x_i; t^*)I(xi+1​;t∗)≤I(xi​;t∗),即下一轮决策可用的信息严格不增。这意味着,即使每一轮的工具选择都是贝叶斯最优的,整体轨迹的正确率也会随循环深度指数下降。这一现象在工程上被反复观察到——长程 Agent 任务(深度超过 5-10 步)的成功率远低于短程任务,部分原因正是信息瓶颈导致的"不确定性雪崩"。

为形式化这一现象,我们引入 不确定性传播方程:

Ui+1=g(Ui,Ei,Li)\mathcal{U}_{i+1} = g(\mathcal{U}_i, \mathcal{E}_i, \mathcal{L}_i)Ui+1​=g(Ui​,Ei​,Li​)

其中 Ei\mathcal{E}_iEi​ 是第 iii 步执行引入的外生噪声(如工具调用超时、返回格式错误、部分信息缺失),Li\mathcal{L}_iLi​ 是上下文长度与压缩损失引入的内生噪声。ggg 是单调非减函数:外生与内生噪声都被累加到下一轮不确定性中。在最坏情况下,若每步的 Ei,Li\mathcal{E}_i, \mathcal{L}_iEi​,Li​ 都不为零,则 Ui\mathcal{U}_iUi​ 随 iii 线性增长,进而错误率随 iii 指数增长。这一结论解释了为什么 ReAct 类 Agent 在长程任务上的失败率往往超过 50%——不是某一轮选错了工具,而是整个轨迹被不确定性累积吞噬。

工程上有三类策略可缓解 ReAct 的不确定性雪崩:

第一类:缩短循环深度。把长程任务分解为子任务,每个子任务独立运行 ReAct 循环,最终通过层级 ReAct 串联。这种"分而治之"策略的代价是子任务边界判定困难——边界划得太粗,子任务内部仍会雪崩;划得太细,子任务间的交接信息容易丢失。

第二类:引入中间审核点。在关键决策步骤(如涉及支付、删除、修改生产的工具调用)之前,插入 Conformal Prediction 触发的拒答机制。这一策略的有效性取决于 Conformal 的覆盖率校准——校准集必须有代表性,且必须与生产环境的工具分布一致。

第三类:显式追踪累积不确定性。在每一轮 ReAct 结束后,计算 Ui\mathcal{U}_iUi​ 的估计值;若 Ui\mathcal{U}_iUi​ 超过预设阈值,提前终止循环并触发人工介入。这一策略需要工程实现一个轻量级的不确定性估计器——可以基于 ensemble disagreement、基于 conformal score 的累积分布、或基于蒙特卡洛 dropout 的多次采样方差。

四、Toolformer 风格的监督校准:Brier、ECE 与温度缩放

工具调用的训练目标与通用语言建模有显著区别。Toolformer 等工作把工具调用建模为监督学习问题:在大量自然语言文本中,自动识别可被工具调用增强的位置,构造(指令, 工具调用, 结果)三元组,然后用监督微调让模型学会在合适位置插入合适的工具调用。这种监督学习的目标函数通常是交叉熵:

LCE=−∑(x,t∗)∈Dlog⁡Pθ(t∗∣x)\mathcal{L}_{\text{CE}} = -\sum_{(x, t^*) \in \mathcal{D}} \log P_\theta(t^* \mid x)LCE​=−∑(x,t∗)∈D​logPθ​(t∗∣x)

但交叉熵最小化并不直接保证校准(calibration)。一个模型可以在交叉熵上表现良好,但 softmax 概率与真实正确率之间存在系统性偏差——这是神经网络的已知现象,已在图像分类、问答、推荐等多个领域被反复验证。

校准的量化有两个经典指标:Brier Score 与 Expected Calibration Error(ECE)。Brier Score 是预测概率与真实标签之间的均方误差:

Brier=1∣D∣∑(x,t∗)∈D∑t∈T(P(t∣x)−1[t=t∗])2\text{Brier} = \frac{1}{|\mathcal{D}|} \sum_{(x, t^*) \in \mathcal{D}} \sum_{t \in \mathcal{T}} \left( P(t \mid x) - \mathbb{1}[t = t^*] \right)^2Brier=∣D∣1​∑(x,t∗)∈D​∑t∈T​(P(t∣x)−1[t=t∗])2

ECE 把预测概率分桶,对每个桶计算桶内平均置信度与桶内实际准确率之差的绝对值,再按桶大小加权:

ECE=∑b=1B∣Bb∣∣D∣∣acc(Bb)−conf(Bb)∣\text{ECE} = \sum_{b=1}^{B} \frac{|B_b|}{|\mathcal{D}|} \left| \text{acc}(B_b) - \text{conf}(B_b) \right|ECE=∑b=1B​∣D∣∣Bb​∣​∣acc(Bb​)−conf(Bb​)∣

其中 BbB_bBb​ 是预测置信度落在区间 (b−1B,bB]\left( \frac{b-1}{B}, \frac{b}{B} \right](Bb−1​,Bb​] 的样本集合。一个完美校准的模型应满足 ECE=0\text{ECE} = 0ECE=0。

对工具调用而言,校准的工程意义极大。考虑如下场景:模型在 100 次相似的"查询订单"指令中,预测工具 "get_order" 的 softmax 概率均为 0.9。若这 100 次中实际只有 60 次选择了正确的工具,那么 ECE ≈ 0.3——模型系统性高估了自身置信度。这种"过度自信"在生产环境中会引发两类问题:(1)模型对工具选择过于自信,不触发人工审核,导致错误率上升;(2)即使模型实际正确,softmax 概率也无法作为风险评估信号,导致上游调度器无法根据置信度动态路由。

温度缩放(temperature scaling)是最简单的校准后处理方法。在验证集上学习一个温度参数 TTT:

PT(t∣x)=softmax(zt(x)T)P_T(t \mid x) = \text{softmax}\left( \frac{\mathbf{z}_t(x)}{T} \right)PT​(t∣x)=softmax(Tzt​(x)​)

其中 zt(x)\mathbf{z}_t(x)zt​(x) 是模型对工具 ttt 的 logits。当 T>1T > 1T>1 时,分布被"软化"(变平坦),降低过度自信;当 T<1T < 1T<1 时,分布被"锐化",适合欠自信场景。温度缩放的优势是不改变模型结构、不影响 top-1 决策,仅调整概率绝对值;劣势是无法解决系统性偏差(不同工具的偏差方向可能不同)。

更精细的校准方法包括 Platt scaling(对每个工具学一个线性缩放)、isotonic regression(对每个工具学一个单调保序变换)、beta calibration(用 Beta 分布族做参数化校准)。这些方法在工具调用场景下的实证效果差异显著,需要根据具体工具集的语义结构选择。

工具调用的校准还有一个独特的挑战:概念漂移。工具集 T\mathcal{T}T 随时间演化(新工具加入、旧工具废弃、schema 变化),训练时学到的校准参数会逐渐失效。生产实践中通常采用滑动窗口 recalibration:用最近 WWW 天的执行日志重新拟合校准参数,每 DDD 天刷新一次。这一做法的有效性高度依赖于校准集与生产分布的一致性——若新工具上线后用户的使用模式与历史模式差异巨大,校准反而会引入新的偏差。

五、Conformal Prediction 在工具选择中的覆盖率保证

Conformal Prediction(CP)是本文理论框架的核心。它是一类仅依赖有限样本交换性(exchangeability)的分布无关不确定性量化方法,能在不需要任何分布假设的前提下,给出有限样本覆盖率保证。CP 的核心思想是:用校准集上的"非一致性分数"(nonconformity score)的分位数,构造未来样本的预测集合。在工具调用场景下,预测集合 C(x)\mathcal{C}(x)C(x) 是工具集 T\mathcal{T}T 的一个子集,满足:

P(t∗∈C(x))≥1−α\mathbb{P}(t^* \in \mathcal{C}(x)) \geq 1 - \alphaP(t∗∈C(x))≥1−α

其中 1−α1 - \alpha1−α 是预先设定的目标覆盖率(如 90%、95%),P\mathbb{P}P 是对校准集与新样本的联合分布。这一保证对任意满足交换性的数据分布都成立——不需要模型是贝叶斯正确的、不需要工具集独立同分布、不需要任何参数假设。

CP 在工具调用中的具体实现分为四步:

Step 1:定义非一致性分数。对工具 ttt,给定输入 xxx,定义分数 s(x,t)s(x, t)s(x,t) 反映"模型对 ttt 的偏好有多强"。最常见的定义是 s(x,t)=1−P(t∣x)s(x, t) = 1 - P(t \mid x)s(x,t)=1−P(t∣x),即 softmax 概率的负向变换。也可以定义为 logits 的负值,或 margin(top-1 概率与 top-2 概率之差)的负向变换。

Step 2:收集校准集。设校准集为 Dcal={(xi,ti∗)}i=1n\mathcal{D}_{\text{cal}} = \{(x_i, t_i^*)\}_{i=1}^{n}Dcal​={(xi​,ti∗​)}i=1n​,包含 nnn 个 (输入, 正确工具) 对。在工具调用场景下,校准集可来自:(a) 人工标注的小批量工具选择对;(b) 真实执行日志中确认成功的调用;(c) 用户反馈中确认正确的调用。校准集的关键要求是与生产分布交换——不能完全来自"简单指令",必须包含各种难度级别的样本。

Step 3:计算分位数。在 Dcal\mathcal{D}_{\text{cal}}Dcal​ 上计算每个样本的分数 {s(xi,ti∗)}\{s(x_i, t_i^*)\}{s(xi​,ti∗​)},再求 (1−α)(1+1/n)(1-\alpha)(1 + 1/n)(1−α)(1+1/n) 分位数 q^\hat{q}q^​。

Step 4:构造预测集合。对新输入 xxx,预测集合为:

C(x)={t∈T:s(x,t)≤q^}\mathcal{C}(x) = \{ t \in \mathcal{T} : s(x, t) \leq \hat{q} \}C(x)={t∈T:s(x,t)≤q^​}

即所有"分数低于分位数"的工具都被纳入预测集合。预测集合大小反映不确定性:集合越小,模型越确定;集合越大(接近 T\mathcal{T}T 全部),模型越不确定。

CP 在工具调用中的工程价值有三层:

第一层:覆盖率保证的工程可解释性。传统 softmax 概率没有理论保证,0.9 的概率可能实际只有 50% 的正确率;而 CP 给出的预测集合保证至少有 1−α1-\alpha1−α 的概率包含真实正确工具。这一保证可直接写入产品文档,作为"我们的工具调用在 X% 情况下会给出可执行的答案"的承诺。

第二层:动态拒答机制。当预测集合过大(如 ∣C(x)∣>Kmax⁡|\mathcal{C}(x)| > K_{\max}∣C(x)∣>Kmax​)时,触发拒答——这等价于一个自适应拒答阈值,避免了人工设定 softmax 概率阈值(如"低于 0.8 就拒答")的脆弱性。

第三层:与代价敏感的兼容。传统 CP 把所有"假阴性"(错过正确工具)视为同等代价;在工具调用中,不同工具的"假阴性"代价差异巨大(错过读操作可重试,错过写操作可能产生副作用)。Cost-sensitive Conformal Prediction 把每个工具有不同的代价权重,调整预测集合的构造方式,使高代价工具更倾向于被纳入集合。这一推广使得 CP 可直接部署到生产环境的异质工具集中。

CP 的局限性同样需要诚实指出:交换性假设在工具调用中并非完全成立——生产环境的工具分布、用户指令分布都在随时间漂移。Adaptive Conformal Inference、Online Conformal Prediction 等近期工作尝试在弱化交换性假设的前提下保持覆盖率保证,但理论保证的强度会随漂移程度衰减。工程实践中通常采用滑动窗口校准(每 DDD 天重算分位数)来近似维护交换性。

六、选择熵与拒答机制:从 selective prediction 到 abstain

把 CP 应用于工具调用时,预测集合大小 ∣C(x)∣|\mathcal{C}(x)|∣C(x)∣ 是一个天然的风险信号:集合越大,模型越不确定。然而,预测集合大小仅刻画了"是否包含正确工具",并未刻画"模型在多大程度上认为正确工具优于错误工具"。选择熵作为补充维度,能区分"两个候选工具都在集合中但置信度差异巨大"与"两个候选工具都在集合中且置信度几乎相同"——后者对应更高的工程风险。

选择性预测(selective prediction)框架把"拒答"视为与"决策"并列的合法输出。设模型对输入 xxx 的输出为 (t∗,a)(t^*, a)(t∗,a),其中 a∈{0,1}a \in \{0, 1\}a∈{0,1} 是"是否拒答"的二元变量。在工具调用场景下,a=1a = 1a=1 表示模型选择执行工具调用,a=0a = 0a=0 表示模型拒答并转人工。选择性预测的目标是:在控制拒答率 r=E[a]r = \mathbb{E}[a]r=E[a] 不超过某个预算的前提下,最大化"接受且正确"的概率。这一目标的形式化是 coverage-controlled risk minimization:

min⁡fE[ℓ(f(x),t∗)]s.t.E[a]≤rmax\min_{f} \mathbb{E}[\ell(f(x), t^*)] \quad \text{s.t.} \quad \mathbb{E}[a] \leq r_{\text{max}}minf​E[ℓ(f(x),t∗)]s.t.E[a]≤rmax​

其中 ℓ\ellℓ 是损失函数(错误工具调用 → 1,正确 → 0,拒答 → ccc),fff 是带拒答选项的预测器。ccc 是拒答的代价值——在工具调用中,这一代价由人工审核的成本与转人工的延迟共同决定。

拒答阈值的最优选择。给定 CP 的预测集合 C(x)\mathcal{C}(x)C(x) 与选择熵 Hchoice(x)\mathcal{H}_{\text{choice}}(x)Hchoice​(x),最优拒答阈值由以下不等式确定:

abstain if ∣C(x)∣>Kmax⁡ or Hchoice(x)>Hmax⁡\text{abstain if } |\mathcal{C}(x)| > K_{\max} \text{ or } \mathcal{H}_{\text{choice}}(x) > H_{\max}abstain if ∣C(x)∣>Kmax​ or Hchoice​(x)>Hmax​

第一个条件基于预测集合大小——当集合过大时,即使包含正确工具,集合内其它工具也可能被错误触发(若自动选择 top-1 执行)。第二个条件基于选择熵——当模型对各工具的偏好接近均匀时,"被迫选一个"的预期代价可能超过拒答代价。Kmax⁡K_{\max}Kmax​ 与 Hmax⁡H_{\max}Hmax​ 的最优取值取决于具体工具集的代价结构。

Abstain 机制与下游责任分配。在生产环境的 Agent 系统中,拒答机制的设计远比"返回 null"复杂。至少有三类下游响应:(a) 透明拒答——告知用户模型对当前任务不确定,建议人工介入;(b) 降级执行——在多个候选工具中选择代价最低的一个执行(如只读工具替代写工具);(c) 延迟执行——把决策推迟到获得更多信息(如用户确认、上下文扩展)后再做。这三类响应的工程实现差异巨大,需要根据产品的责任归属(Agent 承担 vs 人类承担)选择。

Cost-sensitive 拒答。对每个工具定义代价向量 c(t)c(t)c(t)——c(t)c(t)c(t) 可以是直接成本(API 调用费、执行时间)、间接成本(失败时的回滚成本、合规风险)、声誉成本(错误的可见性影响)。总代价可量化为:

Cost(f,x)=∑t∈C(x)P(t∣x)⋅c(t)+1[abstain]⋅cabstain\text{Cost}(f, x) = \sum_{t \in \mathcal{C}(x)} P(t \mid x) \cdot c(t) + \mathbb{1}[\text{abstain}] \cdot c_{\text{abstain}}Cost(f,x)=∑t∈C(x)​P(t∣x)⋅c(t)+1[abstain]⋅cabstain​

最优拒答策略是:当 Cost(f,x)\text{Cost}(f, x)Cost(f,x) 超过人工审核代价 cabstainc_{\text{abstain}}cabstain​ 时选择拒答,否则执行。这一形式化使得拒答决策从启发式("低于 0.8 就拒答")升级为可优化的工程目标。

七、对工程实践的推论:4 条可执行项

把上述理论框架落到工程实践,我们提炼出 4 条今天就可以开始执行的工程建议。这些建议不依赖全新的基础设施,只需要在现有工具调用栈上做小步增量。

建议一:立即给工具调用加上 Conformal 拒答层。这是 ROI 最高的改动。所需材料是少量带标签的工具选择对(500-1000 个即可),所需计算是在校准集上计算非一致性分数并求分位数,所需集成是在推理前增加一层判断:若预测集合过大(∣C∣>Kmax⁡|\mathcal{C}| > K_{\max}∣C∣>Kmax​)则拒答。整个改动可在 1-2 周内完成,无需重训模型。生产环境的可观测性收益是:工具调用的错误率显著下降(因为高风险决策被截留到人工),人工审核工作量可控(因为拒答率由 Kmax⁡K_{\max}Kmax​ 直接控制)。

建议二:建立工具调用的 ECE/Brier 持续监控。在每次工具调用后,记录预测的工具分布 P(t∣x)P(t \mid x)P(t∣x) 与真实结果(成功/失败/参数错误),每天计算 ECE/Brier 并 dashboard 化。当 ECE 超过 0.1 时触发 recalibration 警报。这一监控比传统的"准确率监控"早一步暴露问题——准确率下降是结果,ECE 上升是预警。

建议三:区分 epistemic 与 aleatoric 并路由到不同的人工策略。对每个工具调用决策计算 epistemic-aleatoric 分解(基于 ensemble disagreement 或 conformal score 的分布估计)。aleatoric 主导的任务(信息本身模糊)应直接转人工 + 收集指令澄清数据;epistemic 主导的任务(模型置信度低但信息清晰)应触发"主动学习"——把相似指令的工具选择标签收集起来扩充训练集。这一区分避免了把所有不确定性都扔给人工审核的低效做法。

建议四:建立工具 schema 演化的校准刷新机制。当新工具上线、旧工具废弃、schema 变更时,自动触发校准集的滑动窗口更新。建议的刷新周期是每 24 小时重算分位数、每 7 天重训温度缩放参数。工程实现上,可在 CI/CD 流水线中增加一个"校准健康检查"步骤——若 ECE 超过阈值则阻断发布。

图表加载中…

八、与现有方法的关系与局限

本文提出的统一框架并非孤立的新方法,而是把 Conformal Prediction、Selective Prediction、Calibration、Bayesian uncertainty decomposition 等已有工具系统地移植到工具调用场景。在这一节中,我们澄清与几个相关工作的关系,并诚实指出框架的局限。

与 ReAct、Reflexion、Tree-of-Thoughts 等推理范式的关系。这些推理范式关注"如何让模型更好地思考",本文关注"如何让模型知道自己在不确定"——两者是互补的。一个完整的 Agent 架构应同时具备强推理能力(选对工具的能力)与强不确定性感知能力(知道何时自己选不出来)。把 Conformal Prediction 嵌入 ReAct 的循环中,可以在每一轮 Thought-Action 前增加一层"我应该在这一步拒答吗"的判断。

与 Toolformer、Self-Instruct 等训练方法的关系。这些训练方法关注"如何让模型学会工具调用",本文关注"如何校准模型已经学会的工具调用"。即使训练数据充足、训练目标合理,模型的 softmax 概率仍会系统性偏离真实正确率——这一现象在文献中已被反复验证(参见参考文献 [Guo et al. 2017]、[Minderer et al. 2021] 等)。因此,无论训练侧如何改进,校准侧的工作都是不可省略的。

与 Self-Consistency、CoT 等推理增强方法的关系。Self-Consistency 通过多次采样投票提升准确率,但不直接量化不确定性——多次采样的方差可以作为 epistemic 不确定性的一种估计。CoT(Chain-of-Thought)通过显式推理步骤暴露模型的思考过程,但思考过程本身的可靠性无法保证——模型可能给出语法连贯但语义错误的推理链。本文框架可与这些方法正交结合:用 Self-Consistency 的多次采样估计 epistemic 不确定性,用 Conformal Prediction 校准最终的工具选择。

局限一:交换性假设在长程漂移下失效。本文框架依赖校准集与生产分布的交换性。但生产环境的工具集、用户分布、任务类型都在持续演化,长期运行的系统必然偏离交换性假设。Adaptive Conformal Inference(Gibbs & Candès, 2022)尝试通过在线调整分位数来保持覆盖率,但理论保证的强度随漂移程度衰减。工程实践中需要监控生产分布与校准集的 KL 散度,当漂移过大时触发重新校准。

局限二:校准集的人工成本。CP 要求带标签的工具选择对,这一标签在生产环境中不易获得——需要人工标注、用户反馈、或通过执行成功日志间接构造。三类来源各有缺陷:人工标注成本高、用户反馈稀疏、执行日志只能确认"执行了"无法确认"选对了"。生产实践中通常组合使用三类来源,但仍面临覆盖率与成本的权衡。

局限三:异构代价的工程量化困难。Cost-sensitive CP 假设每个工具有可量化的代价向量,但实际生产中很多代价难以量化(如合规风险、品牌声誉、用户信任)。工程实现上通常退而求其次,把代价简化为"读/写/支付"三类,每类内部假设代价均匀。这一简化丢失了大量信息,可能导致拒答策略偏离最优。

局限四:本文未涉及多智能体协作场景。当多个 Agent 协同完成任务时,工具调用决策受到其它 Agent 决策的影响,不确定性传播路径更加复杂。后续研究将探索多智能体 Conformal Prediction 的扩展形式。

九、给研究者的展望

工具调用作为 Agent 与外部世界交互的核心原语,已经成为大模型应用的关键基础设施。从不确定性视角重新审视工具调用,我们看到了一个横跨统计学、机器学习、人机交互的丰富研究空间。最后,我们给研究者提出三个值得关注的方向。

方向一:工具调用的分布外检测。当前 Conformal 框架依赖交换性假设,在分布外(OOD)样本上表现不可预测。如何在工具调用场景中检测 OOD 输入(用户尝试用工具调用越权访问、Prompt 注入诱导工具误调用、新工具加入导致历史校准失效)并给出鲁棒的拒答策略,是一个开放问题。密度感知 Conformal、代表性加权 CP 等近期方法可作为起点。

方向二:工具调用的可解释不确定性。Conformal Prediction 给出的预测集合虽然有理论保证,但缺乏可解释性——"为什么这 3 个工具都被纳入集合"对工程调试不友好。如何把预测集合的构造过程可视化、与模型的可解释性方法(如 attention rollout、circuit discovery)结合,是值得探索的方向。

方向三:工具调用的隐私保护校准。当校准集包含敏感信息(如内部业务流程、用户指令历史)时,CP 的统计保证可能泄露隐私。Differentially Private Conformal Prediction 是近期热点方向,把 (ϵ,δ)(\epsilon, \delta)(ϵ,δ)-DP 与有限样本覆盖率保证结合,在保护隐私的同时维持统计性能。这一方向对金融、医疗、法律等高隐私行业有直接应用价值。

回顾全文,我们论证了工具调用本质上是一个受不确定性驱动的决策过程,可以用 epistemic-aleatoric 分解 + 选择熵 + Conformal 覆盖率保证 + cost-aware 拒答阈值的统一框架进行量化与工程化。这一框架的引入,使得工具调用从"看起来能做事的系统"升级为"知道自己在多大程度上能做事的系统"——后者才是可信赖的 Agent 系统应有的能力。

参考文献

  1. Vaswani A, Shazeer N, Parmar N, et al. Attention is all you need. NeurIPS 2017.
  2. Brown TB, Mann B, Ryder N, et al. Language models are few-shot learners. NeurIPS 2020.
  3. Wei J, Wang X, Schuurmans D, et al. Chain-of-thought prompting elicits reasoning in large language models. NeurIPS 2022.
  4. Yao S, Zhao J, Yu D, et al. ReAct: Synergizing reasoning and acting in language models. ICLR 2023.
  5. Schick T, Dwivedi-Yu J, Dessì R, et al. Toolformer: Language models can teach themselves to use tools. NeurIPS 2023.
  6. Vovk V, Gammerman A, Shafer G. Algorithmic learning in a random world. Springer 2005.
  7. Shafer G, Vovk V. A tutorial on conformal prediction. JMLR 2008.
  8. Romano Y, Patterson E, Candès EJ. Conformalized quantile regression. NeurIPS 2019.
  9. Gibbs I, Candès EJ. Adaptive conformal inference under distribution shift. NeurIPS 2021.
  10. Angelopoulos AN, Bates S. A gentle introduction to conformal prediction and distribution-free uncertainty quantification. Foundations and Trends in Machine Learning 2022.
  11. Guo C, Pleiss G, Sun Y, et al. On calibration of modern neural networks. ICML 2017.
  12. Minderer M, Djolonga J, Romijnders R, et al. Revisiting the calibration of modern neural networks. NeurIPS 2021.
  13. Kendall A, Gal Y. What uncertainties do we need for Bayesian deep learning? NeurIPS 2017.
  14. Geifman Y, El-Yaniv R. Selective classification for deep neural networks. NeurIPS 2017.
  15. Bartlett PL, Wegkamp MH. Classification with a reject option. COLT 2008.
  16. Lindley DV. Understanding uncertainty. Wiley 2006.
  17. Hüllermeier E, Waegeman W. Aleatoric and epistemic uncertainty in machine learning: An introduction to concepts and methods. Machine Learning 2021.
  18. McAllister R, Kahn G, Clune J, et al. Robustness to out-of-distribution inputs via task-aware constrained uncertainty. ICML 2019.
  19. Boukhouma A, Scherrer Y. Conformal prediction with reinforcement learning. PMLR 2023.
  20. Lei J, G'Sell M, Rinaldo A, et al. Distribution-free predictive inference for regression. JASA 2018.
  21. Barber RF, Candès EJ, Ramdas A, et al. Predictive inference with the jackknife+. Annals of Statistics 2021.
  22. Sun S, Yu R, Wang X. Conformal prediction for time series. ICML 2022.

本文为理论分析性研究,所有方法论描述基于 2024-2026 年公开文献综合。具体的工程落地建议需结合实际生产环境验证。截至 2026-08-24,本文描述的框架尚未有公开的端到端工业部署报告,相关实证数据为概念验证级别。

相关文章

  • Agent 工具调用的幂等性与中断传播工程 20268月23日
  • Agent 长时记忆的遗忘曲线理论 2026:从 Ebbinghaus 到检索增强的统一动力学框架8月23日
  • Agent 工具注册中心与版本管理 2026:从 schema 演进到灰度发布的工程范式8月22日

评论

加载评论中…

发表评论

返回文章列表