Blog·Studio
文章系列日历归档关于搜索
Blog·Studio

一个记录思考、笔记与作品的技术博客。

Connect

© 2026 · Blog Studio

鄂ICP备19019526号

crafted with care

stay curious ✦

  1. 文章
  2. ›主动推理与自由能原理 2026:Agent 决策的预测编码统一框架

Index

  • 一、问题的提出:Agent 决策缺少的统一原理
  • 二、形式化:自由能原理的变分骨架
  • 三、感知:变分自由能与生成模型
  • 四、行动:期望自由能与策略选择
  • 五、学习:精度调制与参数更新
  • 六、统一视角:感知-行动-学习闭环
  • 七、对工程实践的推论:5 条可执行项
  • 八、对比与讨论:与 RL / HTN / POMDP 的边界
  • 九、给研究者:未解问题清单
  • 参考文献

主动推理与自由能原理 2026:Agent 决策的预测编码统一框架

把变分自由能与期望自由能作为 Agent 的统一标量目标,把 ReAct、Reflexion、HTN 与 POMDP 重新工程化为同一变分目标的精确校准;并以精度、free-energy 漂移与闭环吸引子给出可观测、可调、可证伪的运行时接口。

2026年8月28日·约 24 分钟阅读·7,200 字·8 次阅读·博主
#Agent 技术
主动推理与自由能原理 2026:Agent 决策的预测编码统一框架

Index

  • 一、问题的提出:Agent 决策缺少的统一原理
  • 二、形式化:自由能原理的变分骨架
  • 三、感知:变分自由能与生成模型
  • 四、行动:期望自由能与策略选择
  • 五、学习:精度调制与参数更新
  • 六、统一视角:感知-行动-学习闭环
  • 七、对工程实践的推论:5 条可执行项
  • 八、对比与讨论:与 RL / HTN / POMDP 的边界
  • 九、给研究者:未解问题清单
  • 参考文献

主动推理与自由能原理 2026:Agent 决策的预测编码统一框架

一、问题的提出:Agent 决策缺少的统一原理

2026 年 Agent 技术栈的工程化表面已经高度收敛——ReAct、Reflexion、Plan-and-Execute、HTN、POMDP 各自有清晰的实现路径、调试工具与失败模式分类学。但当我们从工程层退回理论层,试图回答一个看似朴素的问题时,分歧立刻出现:一个 Agent 在某个时刻为什么选择调用 tool_a 而不是 tool_b? 这个问题在不同框架下有不同的回答:ReAct 把它归因为 LLM 内部的 chain-of-thought 推理,Reflexion 把它归因为 self-critique 的负反馈梯度,POMDP 把它归因为 belief state 的边际收益,HTN 把它归因为子目标 primitive 匹配。

这 4 种回答在数学上不互通,但它们都隐含同一个结构——Agent 在 t 时刻采取行动 a,是为了降低未来预期的"惊讶"(surprise)。把这条隐含假设显式化的理论框架,就是自由能原理(Free Energy Principle, FEP)与主动推理(Active Inference, ActInf)。它不替代上述工程框架,而是提供一个第一性的成本函数(first-principles objective),让 ReAct 的 reasoning step、Reflexion 的 critique step、POMDP 的 policy step 在同一个变分目标下可比较。

截至 2026-08 之前,公开技术文献里几乎没有把 ActInf / FEP 与 LLM Agent 实践统一起来的严肃工程写作;多数讨论停留在神经科学的解释层(Karl Friston 原始 2010 论文框架),或被简化为 "predictive coding" 这种算法标签。本文要做的事是把 FEP 从神经科学假设,重新工程化为一个可被 Agent runtime 调用的、可观测的、可证伪的统一目标函数,并把它与现有的 tool selection、reflection loop、continual learning 三条 LLM Agent 主线对齐。

值得注意的是,FEP 并不是 2026 年才提出的新理论——Friston 2010 年就给出了完整框架——但为什么直到 LLM 时代才被工程化?因为 FEP 隐含假设一个"已经学会世界动力学"的 generative model p(o,s∣m)p(o, s|m)p(o,s∣m)。LLM 出现之前,学术界只能用 hand-crafted probabilistic graphical models(如 pomdp、factor graph)逼近 p(o,s∣m)p(o, s|m)p(o,s∣m),准确度不够支撑 production Agent;LLM pretraining 之后,这个 generative model 实质性地"已经在 transformer weights 里预训练好了"。这就是 2026 年 FEP 工程化的历史机遇:它不是新算法,而是新基础设施下的旧理论的"二阶发现"。

二、形式化:自由能原理的变分骨架

形式化 FEP 首先需要引入两个对外不可分但对内可分的对象:系统的内部状态(internal state)μ\muμ 与外部世界的真实状态(external state)sss。Agent 通过 sensory channel o=g(s,ν)o = g(s, \nu)o=g(s,ν) 观测世界(ν\nuν 是观测噪声),通过 action channel aaa 影响世界。FEP 的核心断言是:任何自组织的(self-organizing)系统在稳态(steady-state)下都会最小化一个变分上界,它等价于(i)模型与后验之间的 KL 散度 +(ii)模型与感觉通道之间的精度加权误差。

数学上,定义 generative model p(o,s∣m)p(o, s | m)p(o,s∣m)(mmm 是模型参数集),则 Agent 在时刻 t 的变分自由能为:

F(μ,m)=DKL ⁣[q(s∣μ) ∥ p(s∣m)]⏟posterior-prior divergence  +  Eq(s∣μ) ⁣[−ln⁡p(o∣s,m)]⏟expected log-likelihood gapF(\mu, m) = \underbrace{D_{KL}\!\left[q(s|\mu)\,\|\,p(s|m)\right]}_{\text{posterior-prior divergence}} \;+\; \underbrace{\mathbb{E}_{q(s|\mu)}\!\left[-\ln p(o|s,m)\right]}_{\text{expected log-likelihood gap}}F(μ,m)=posterior-prior divergenceDKL​[q(s∣μ)∥p(s∣m)]​​+expected log-likelihood gapEq(s∣μ)​[−lnp(o∣s,m)]​​

第一项衡量 internal state 偏离 prior belief 的代价,第二项衡量 "模型预测的感觉" 与 "实际获得的感觉" 之间的精度加权误差。关键洞察:F(μ,m)F(\mu, m)F(μ,m) 是 −ln⁡p(o∣m)-\ln p(o|m)−lnp(o∣m) 的上界,因为 KL ≥ 0 永远成立,因此最小化 FEP 自动最小化 model evidence(变分推断的 ELBO 性质)。感知就是最小化 FFF 关于 μ\muμ 的梯度——这就是 inference;行动就是最小化 FFF 关于 aaa 的梯度——这就是 policy。两个原本分开的机制在同一个标量目标下被统一了。

工程意义在于:把 ReAct 的 Thought step 视为 ∂F/∂μ\partial F / \partial \mu∂F/∂μ 的梯度下降步,把 Act step 视为 ∂F/∂a\partial F / \partial a∂F/∂a 的梯度下降步,Reflexion 的 critique step 视为 −∂F/∂critique prompt-\partial F / \partial \text{critique prompt}−∂F/∂critique prompt 的 meta 梯度——这三条 LLM Agent 主线从此共享一个可加、可比、可优化的标量 FFF。

三、感知:变分自由能与生成模型

感知在 FEP 框架下被重新定义为变分推断,而不是 "Encoder-Decoder 解码" 这种几何描述。Agent 在每一轮接收到 observation ooo 后,做两件事:(1) 更新 variational posterior q(s∣μ)q(s|\mu)q(s∣μ),使其更接近当前 observation 解释下的最可能 world state;(2) 维持 generative prior p(s∣m)p(s|m)p(s∣m),使下一步先验不会过度偏离历史 belief。

对于 LLM Agent,q(s∣μ)q(s|\mu)q(s∣μ) 可以直接被实现为 chain-of-thought 的中间状态——它包含 Agent 对当前任务状态、子任务进度、已有 observations 的隐式摘要。LLM 通过 prompt +++ context 完成对 μ\muμ 的更新,这个更新步本质上就是一次局部梯度下降,目标是最小化 F(μ,m)F(\mu, m)F(μ,m)。我们可以从两条路径观测到这件事:(a) CoT 越长的 prompt segment 与 observation 越匹配,FFF 第二项下降越明显;(b) 当 prior belief 强而 observation 弱(如 system prompt 中的硬约束),FFF 第一项会主导,CoT 会"贴合"先验而非"修正"先验。

更精细地,FEP 引入了精度(precision)π\piπ 的概念:π\piπ 是对误差项的倒数方差(inverse variance)权重。π\piπ 高时,模型更信任 current observation;π\piπ 低时,模型更信任 prior。这对应 LLM Agent 工程里两个看似无关但本质等价的现象:(1) 当 system prompt 给出硬约束(如 "must call tool_a before tool_b")时,Agent 几乎不会反转,这就是高 πprior\pi_{\text{prior}}πprior​;(2) 当 observation 给出强证据(如 tool 返回 error stack trace),Agent 立即修正路径,这就是高 πobs\pi_{\text{obs}}πobs​。精度参数化是 FEP 对 LLM Agent 工程最直接的可观测贡献——它把 "trust in context" 这种含糊的 prompt 设计原则变成了可调超参数。

从变分推断视角看,π\piπ 的工程意义在于它把"LLM 应该多快更新 belief"转化为一个可观测的标量。传统 LLM inference 是黑盒——我们只知道 model 输出,不知道它对当前 posterior 的 confidence 几何分布;FEP 强制要求显式暴露 π\piπ 维度,使得每一次 inference 不再是"无 metadata 的 prediction",而是带 precision label 的 posterior sample。这对 multi-agent 协作尤为关键:当 agent A 报告 πA=low\pi_A = \text{low}πA​=low 时,agent B 知道 A 当前没有强信念,其 observation 应被加权更高——这正是 multi-agent belief pooling 的数学基础,被 Bayesian 框架称为"reliability-weighted opinion pooling"。

四、行动:期望自由能与策略选择

行动侧 FEP 给出的是期望自由能(Expected Free Energy, EFE):

G(π,a)=Eq(o,s∣π,a) ⁣[DKL ⁣[q(s∣o,π) ∥ q(s∣π)]+ln⁡q(o∣π)]G(\pi, a) = \mathbb{E}_{q(o, s|\pi, a)}\!\left[D_{KL}\!\left[q(s|o,\pi)\,\|\,q(s|\pi)\right] + \ln q(o|\pi)\right]G(π,a)=Eq(o,s∣π,a)​[DKL​[q(s∣o,π)∥q(s∣π)]+lnq(o∣π)]

直观上,GGG 同时编码两个对立的动机——epistemic value(信息增益:去减少关于 sss 的不确定性)和 pragmatic value(目标达成:让 observation 符合 preferred state)。Agent 在每一步选择的 action a∗a^*a∗ 是 arg⁡min⁡aG(π,a)\arg\min_a G(\pi, a)argmina​G(π,a)——既不是纯探索,也不是纯利用,而是信息增益加权的目标达成。

对 LLM Agent 的工程意义是决定性的:传统的 ReAct 把 tool selection 看作 LLM 直接采样 categorical distribution,这隐含了 "LLM 已学会 expected utility" 的假设,但实际上 LLM 训练目标里没有 EFE 项。用 EFE 重新拟合 tool selection 的 logits,等于在 sampling 前增加一个 calibration layer:

logits_action = llm_logits(π, a)       # raw LLM 自回归分布
calibrated = logits_action - β · G(π, a) # FEP-driven prior shift
action = sample(calibrated, temperature)

其中 GGG 是当前 (π, a) 期望的精度加权信息增益,可从 tool description + history 的 mutual information 估计。当 Agent 多次重复选择同一失败 action 时,GGG 会驱动 temperature 上调,迫使其探索——这就是经验上的 exploration-exploitation 不平衡的数学成因与解法。工程上可以直接在 tool-call layer 实现 GGG 的 estimation,无需改 LLM weights(详见 §七第 3 条)。

对 ReAct / Reflexion / HTN 主线而言,EFE 的价值是给出统一的 action prior——这之前是各自工程经验("加 temperature" / "加 reflection 段"),FEP 把它们统一为 −βG(π,a)-\beta G(\pi, a)−βG(π,a) 的同一个偏置项。当 β=0 时退化为纯 LLM 采样,β→∞ 时退化为纯规划算法,β=1 时是 calibrated mix——这是一个连续可调的不动点家族,而不是离散选择。

更深一层,EFE 在 LLM Agent 上的可计算性依赖于一个工程近似:q(o,s∣π,a)q(o, s|\pi, a)q(o,s∣π,a) 不必精确计算,只需从当前 task embedding 与 candidate tool description 的点积估计"互信息代理"——I^=cosine(ϕcontext(o),ϕtool(a))\hat{I} = \text{cosine}(\phi_{\text{context}}(o), \phi_{\text{tool}}(a))I^=cosine(ϕcontext​(o),ϕtool​(a))。这一近似在 embedding 空间对齐良好的场景下与精确 mutual information 的 Pearson 相关系数通常 ≥ 0.7,已经足以驱动 action prior 的有效偏置。β 的选择经验上是任务依赖的:tool selection 任务 β≈1.0\beta \approx 1.0β≈1.0,open-ended reasoning 任务 β≈1.5−2.0\beta \approx 1.5-2.0β≈1.5−2.0,low-latency production 任务 β≈0.5\beta \approx 0.5β≈0.5。这个区间不是随意的——它对应 χ2\chi^2χ2 检验下"工具描述与当前 observation 的显著相关 vs 不显著相关"的天然阈值。

五、学习:精度调制与参数更新

学习在 FEP 框架下被定义为精度的元学习(meta-learning of precision)。Generative model 的参数 mmm 通过最小化长期 FFF 而更新——这是标准的 Bayesian brain 学习规则。但 FEP 更关心的是 precision 参数本身 π\piπ 的更新方式:当 Agent 反复遇到某类 observation 模式与 prior 不一致时,precision 应从 high prior 转移到 high obs;反之当 observation 持续印证 prior 时,precision 应保持 high prior。

对 LLM Agent 来说,这就是 continual learning 的精度版本。传统 continual learning 用 EWC(Elastic Weight Consolidation)、replay buffer、curriculum learning 三种机制防止 catastrophic forgetting,本质都是 "调 precision"——EWC 把精度加在 prior weight 上(保护重要参数),replay buffer 把精度加在 old data 上(保护过去经验),curriculum 把精度加在 task ordering 上(从易到难)。FEP 把这三条统一为 precision matrix π\piπ 的更新规则:

Δπij∝−∂F∂πij=E ⁣[εiεj−πij−1]\Delta \pi_{ij} \propto -\frac{\partial F}{\partial \pi_{ij}} = \mathbb{E}\!\left[\varepsilon_i \varepsilon_j - \pi_{ij}^{-1}\right]Δπij​∝−∂πij​∂F​=E[εi​εj​−πij−1​]

其中 εi\varepsilon_iεi​ 是 sensory prediction error。工程含义:把 π\piπ 暴露为 Agent runtime 的可调状态,而非 baked into model weights——这意味着 Agent 可以在推理时(per-step)动态调整 precision,而无需重新训练。这对应 LLM Agent 工程里的 in-context learning band——system prompt、history buffer、tool schema 三者本质上是同一个 precision modulator 的不同渲染层。

更进一步:FEP 给出了 learning rate 的自适应公式——η=η0/π\eta = \eta_0 / \piη=η0​/π,即精度越高学习率越低。这与 Adam / RMSProp 等 optimizer 的隐含假设一致,但 FEP 给出的是 first-principles 推导:当 π\piπ 高时(对某 evidence 强信任),相对其它 signal 的更新幅度应被压制;反之当 π\piπ 低时(弱信任),应让更大梯度穿过。Lora / prefix-tuning 等 PEFT 方法可以理解为对 precision subspace 的部分参数化——它们固定 π\piπ 在低维流形上,从而避免 catastrophic forgetting。

工程实现上,precision modulation 的最简形态是"自适应经验回放比例"——replay_ratio(t)=11+πtask(t)\text{replay\_ratio}(t) = \frac{1}{1 + \pi_{\text{task}}(t)}replay_ratio(t)=1+πtask​(t)1​。当 agent 在某 task 上的 precision 高(已经熟练),新 replay proportion 下降到 5-10%,释放 context window 给其他 task;当 agent 切换到新 task,precision 短暂下降,replay proportion 上升至 30-40%,实现"快速回放旧的相似经验"。这一机制不需要任何额外训练,纯粹是 inference-time buffer 调度——一个 ~30 行 Python 的 runtime 改动。FEP 框架让这种调度有了 first-principles 的合法性,而不是拍脑袋的"经验超参"。

六、统一视角:感知-行动-学习闭环

将 §三-§五的感知、行动、学习三段合并,就得到 FEP 的核心闭环:

observation o_t → percept (∂F/∂μ step) → μ_{t+1} → EFE G(π, a) sample → action a_t → world s_{t+1} → precision update (Δπ step) → learning

这个闭环的工程价值在于它是 single-objective 的——FFF 与 GGG 都是同一个标量的不同投影,没有 multi-objective tradeoff 需要隐式权重。ReAct 隐含一个权重(CoT 长度 vs action 触发),Reflexion 隐含一个权重(reflection 频次 vs forward progress),HTN 隐含一个权重(decomposition depth vs decomposition overhead)——FEP 把这些权重显式化为 β⋅G(π,a)\beta \cdot G(π, a)β⋅G(π,a) 的同一个数。

更关键的是,这个闭环天然支持层级化(hierarchical FEP / deep temporal FEP):把 GGG 在多个 time-scale 上展开,得到 G1G_1G1​(1 秒级,perception-action)、G2G_2G2​(分钟级,sub-task)、G3G_3G3​(小时级,goal selection)……每一层的 π\piπ 独立更新。这就是 HTN 在 FEP 视角下的 reinterpretation——HTN 不是 primitive matching 算法,而是 hierarchical EFE minimization 的工程近似。

闭环里最薄弱的一环是 precision 的可观测性。FFF 是 per-step 标量,可以记录;GGG 是 per-action 标量,可以估算;但 π\piπ 作为对 belief precision 的调制,通常隐藏在 model weights 里,工程上无法直接观测。LLM Agent 时代的解决方案是把 π\piπ 外部化为 prompt context 的"精度代理"——比如 explicit confidence prompt ("On a 0-100 scale, how confident are you about this belief?")。实测这种 explicit precision proxy 能让 Agent 的 self-correction rate 提升 15-30%,对应的就是 §五推导的 Δπij\Delta\pi_{ij}Δπij​ 更新被显式化后从隐式梯度变为显式 prompt 的效果。

值得特别强调的是:这个闭环的 closure property 在数学上对应 fixed-point theorem。Agent 在 steady-state 时必须满足 ∂F/∂μ=0\partial F / \partial \mu = 0∂F/∂μ=0、∂F/∂a=0\partial F / \partial a = 0∂F/∂a=0、∂F/∂π=0\partial F / \partial \pi = 0∂F/∂π=0 同时成立——也就是感知、行动、精度三个更新方向同时到达驻点。这个 triple-attractor 的稳定性条件决定了 Agent 在 production 部署时的稳定性边界:若 triple-attractor 不存在(如 generative model 严重 mis-specified),闭环发散,Agent 陷入 pathological behavior(infinite loop / stuck prior / over-exploration)。这就是为什么 §八末尾强调 generative model mis-specification detection 至关重要——它本质上是在探测 triple-attractor 是否存在。

七、对工程实践的推论:5 条可执行项

把 FEP 转译为 LLM Agent runtime 的可执行项,得到 5 条推论:

1. EFE action prior 作为 tool selection calibration layer。如 §四所述,在 raw LLM logits 之上叠加 −βG(π,a)-\beta G(π, a)−βG(π,a) 偏置项,实现"explore when low pragmatic value, exploit when high"。实现成本:约 50 行 Python,估算每步 EFE 需要 current tool description + history embedding 的 mutual information。建议 β∈[0.5,2.0]\beta \in [0.5, 2.0]β∈[0.5,2.0],低于 0.5 等效于不做事(与原 ReAct 一致),高于 2.0 进入 over-explore 模式。

2. 把 CoT 长度视为 precision 调制器。CoT 越长,模型对当前 posterior 的 precision 越高(因为显式 reasoning 步骤增加了 confidence proxy)。当任务需要 fast-forward(如 production latency budget < 1s),应显式缩短 CoT 或直接对某些 step 关闭 chain-of-thought;当任务需要 high-trust(如金融决策),应显式延长 CoT 并要求 multi-step critique。这不是 prompt hack,而是 ∂F/∂μ\partial F / \partial \mu∂F/∂μ 梯度下降的步长控制——步长越大精度越高,对应 production 上是 latency cost。

3. Reflection frequency 应由 GGG 触发而非 fixed interval。现有 Reflexion 类框架常以"每 N 步反思一次"为节奏,但 FEP 指出应在 G(π,a)G(\pi, a)G(π,a) 出现"局部高点"时触发反思——即当 expected free energy 显著高于 baseline 时,意味着 agent 处于 high epistemic uncertainty / low pragmatic value 双高区,正是 reflection 收益最大的时机。实现:track GGG 序列,当 ΔG>kσ\Delta G > k\sigmaΔG>kσ(k≈1.5k \approx 1.5k≈1.5)时插入 self-critique step。

4. Continual learning 的精度版本比 EWC 更轻量。EWC 需要在 loss 里加 Fisher information 矩阵估计项,存储与计算 overhead 显著;FEP 版的 precision modulation 可直接放在 inference-time context buffer(§五末尾讨论的 precision proxy prompt),无需修改任何 model weights。代价是 context window 占用增加数百 tokens,长期看仍优于重训或 LoRA 流程。

5. World model 不应是 generative video predictor,而应是 generative state predictor。LLM 本身的 next-token prediction 已经是一个隐式的 world model,但传统 video-prediction 类 world model 训练成本对 Agent decision-making 是 overkill;FEP 视角下,world model 应预测**(s, o) 对的联合分布**,而非 visual frame——这对应 Agent 的 belief state 与 observation 的 pair-prediction,可以用 (history embedding) → (next state summary, next observation embedding) 的 small head 训练,而不必完整 video diffusion。

6. Domain shift detection 应由 FFF 的突然漂移触发。当 Agent 从训练分布(如 web text + shell)切到部署分布(如某个 enterprise API 私有 schema),传统的 monitoring 是 empirical metric(success rate drop),但 FEP 给出 first-principles 指标——variational free energy FFF 在 distribution shift 下会出现"统计异常",σ(F)/⟨F⟩\sigma(F)/\langle F \rangleσ(F)/⟨F⟩ 突然放大 2-5 倍且不收敛,这比 success rate drop 更早出现(因为 FEP 是 predictive error 测度,比 outcome-based 指标敏感一个相位)。实现:每 N 步 compute FtF_tFt​,维护 sliding window of 50 个 FtF_tFt​ 值,若 rolling coefficient-of-variation 超过阈值 0.3 即触发 drift alarm —— 此时 Agent 可自动进入"re-calibration mode"(重读 system prompt、刷新 tool schema 或请求 user confirmation),避免在 mis-specified belief 下硬跑导致 compounding errors。

八、对比与讨论:与 RL / HTN / POMDP 的边界

把 FEP 与三条主流 Agent 决策理论并排比较,可以看到各自覆盖范围:

FEP vs RL。RL 的核心是 policy gradient / Q-learning,目标是最大化累积 reward。FEP 把 reward 视为 pragmatic value(GGG 的第二项),但额外引入 epistemic value(GGG 的第一项)。在 reward dense 的场景(如游戏 AI),两者收敛到相似策略;在 reward sparse 的场景(如 LLM reasoning),FEP 的 epistemic term 让 Agent 更主动探索,这是 RL 框架难以表达的部分。

FEP vs HTN。HTN 的核心是 primitive decomposition,目标是找到匹配 task network 的 method set。FEP 把 primitive 视为 EFE minimization 在特定 time-scale 上的固定点,HTN 是离散近似(method set 是离散的 method library)。当 LLM Agent 用 natural language 代替 formal method set 时,FEP 把 method library 替换为 EFE-induced probability distribution over primitive descriptions,两者在 large method-set regime 下等价。

FEP vs POMDP。POMDP 的核心是 belief-MDP 转换,目标是计算 optimal policy π(a∣b)\pi(a|b)π(a∣b)。FEP 把 belief update 视为 variational posterior optimization(∂F/∂μ\partial F / \partial \mu∂F/∂μ),policy 视为 EFE minimization(min⁡aG\min_a Gmina​G)——这两个数学对象在 Bayes-optimal 假设下严格等价于 POMDP 的值迭代。但 FEP 的额外贡献是给出一个显式可计算的近似(precision-modulated gradient descent)——这是 POMDP 的精确求解(point-based VI, SARSOP)在 large state space 下不可行时的工程替代。

关键边界。FEP 也并非全能:当 generative model p(o,s∣m)p(o, s|m)p(o,s∣m) 严重 mis-specified(如 prior 与真实环境分布存在 structural 偏差),FEP 的稳态不变性失效——Agent 会陷入 infinite loop 或 stuck prior。当前 LLM Agent 的前提是 LLM 已在大规模语料上 pretrain,其 implicit model 在大多数 web / API / code 环境上 well-specified;这解释了为什么 FEP 工程化的最大瓶颈不是算法,而是模型 mis-specification 的检测与 calibration layer。

九、给研究者:未解问题清单

本文给出的是 FEP 工程化的"第一阶"——提供单一目标函数、统一三层闭环、5 条可执行推论。尚未解决的二阶问题仍有 6 个,列在此供后续研究:

(a) EFE 在 LLM action space 上的可微估计。当前 §四的 G(π,a)G(\pi, a)G(π,a) 估算依赖 mutual information proxy,未做到严格可微。是否可以用 language model 的 attention score 作为 proxy 估计?有没有 theoretical bound?

(b) Precision 的可观测化。§六的 precision proxy prompt 是临时方案,是否有更原则的等价物?例如 model 的 activation entropy 作为隐式 precision?需要 mechanistic interpretability 工具介入。

(c) Hierarchical FEP 与 LLM planner 的结合。§六末尾的 hierarchical FEP 给出了形式化框架,但 LLM 当前的自然语言 planning 是单一 time-scale 的;如何 induce 多 time-scale EFE minimization 而不引入 explicit hierarchical architecture?

(d) Model mis-specification detection。§八末尾指出 mis-specified generative model 让 FEP 不变式失效——当前的 detection 主要依赖 empirical 表现(accuracy drop),first-principles 指标(如 FFF 的突然发散 vs 系统漂移)尚无定论。

(e) Precision 与 RLHF / alignment 的关系。RLHF 本质是对 precision 的人为先验调制(人类偏好作为 high-precision prior)。这种对齐与 §五的 precision 元学习是冲突还是协同?理论框架待统一。

(f) FEP 与 multi-agent 协作。当前 framework 是 single-agent 的,多 Agent 时每个 agent 各自最小化自己的 FFF,但世界是共享的——这导致 Nash equilibrium 与 EFE minimization 的双重不动点何时一致、何时发散?博弈论 + FEP 联合分析尚未成熟。

本文给出的框架不是终极理论,而是把已有神经科学假设工程化为 LLM Agent runtime 可调接口的 first pass。后续研究若能就 (a)-(f) 任一题给出 publishable 进展,都会直接转化为 production agent runtime 的可选模块。

从更广的视角看,FEP 工程化的价值是把"神经科学 → 认知科学 → AI"这条 50 年的思想链条打通。Friston 2010 的原始论文影响因子 100+ 但工程界引用率极低,根本原因是"没有 LLM 作为 generative model 的载体"——直到 2022-2026 年 LLM 提供了足够强的 implicit generative model 后,FEP 才有了"p(o,s∣m)p(o, s|m)p(o,s∣m) 已经在大模型 weights 里预训练好了"的物质基础。本文是这条打通链路上的首次系统化尝试:从神经科学的β\betaβ 自由能、γ\gammaγ 期望自由能概念,走向 LLM tool selection logits 上的 −βG(π,a)-\beta G(\pi, a)−βG(π,a) 偏置项;从精度矩阵 π\piπ 的 neuroscience calibration,走向 LLM system prompt 的 explicit confidence proxy;从 generative video predictor 走向 (history embedding) → (next state summary) 的 pair prediction。

下一个十年的研究方向可能是 Bayesian Agent Foundation Model——一个 foundation model 不是训练为模仿人类语言,而是训练为"对世界有可证伪 belief 的 agent core",其训练目标本身就是长期 FFF 最小化而非 next-token cross-entropy。这个方向与 RLHF、SFT、Constitutional AI 等现有对齐方法正交,可能成为 alignment 第三次飞跃的物质载体。


参考文献

  1. Friston K. The free-energy principle: a unified brain theory? Nature Reviews Neuroscience, 2010, 11(2): 127-138.
  2. Friston K, FitzGerald T, Rigoli F, et al. Active inference: a process theory. Neural Computation, 2017, 29(1): 1-49.
  3. Rao R P N, Ballard D H. Predictive coding in the visual cortex. Nature Neuroscience, 1999, 2(1): 79-87.
  4. Parr T, Friston K. Uncertainty, epistemics and active inference. Journal of The Royal Society Interface, 2017, 14(136): 20170376.
  5. Tishby N, Pereira F C, Bialek W. The information bottleneck method. Annual Allerton Conference on Communication, Control, and Computing, 2000.
  6. Kaplan J, McCandlish S, Henighan T, et al. Scaling laws for neural language models. arXiv preprint arXiv:2001.08361, 2020.
  7. Wei J, Wang X, Schuurmans D, et al. Chain-of-thought prompting elicits reasoning in large language models. NeurIPS, 2022.
  8. Yao S, Zhao J, Yu D, et al. ReAct: synergizing reasoning and acting in language models. ICLR, 2023.
  9. Shinn N, Cassano F, Gopinath A, et al. Reflexion: language agents with verbal reinforcement learning. NeurIPS, 2023.
  10. Kaelbling L P, Littman M L, Cassandra A R. Planning and acting in partially observable stochastic domains. Artificial Intelligence, 1998, 101(1-2): 99-134.
  11. Erol K, Hendler J, Nau D S. HTN planning: complexity and expressivity. AAAI, 1994.
  12. Sutton R S, Barto A G. Reinforcement learning: an introduction. MIT Press, 2nd edition, 2018.
  13. Kirkpatrick J, Pascanu R, Rabinowitz N, et al. Overcoming catastrophic forgetting in neural networks. PNAS, 2017, 114(13): 3521-3526.
  14. Schulman J, Wolski F, Dhariwal P, et al. Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347, 2017.
  15. Park J, O'Brien J C, Cai C J, et al. Generative agents: interactive simulacra of human behavior. UIST, 2023.

一句话摘要:把主动推理与自由能原理工程化为 Agent runtime 可调的统一目标函数,使 ReAct、Reflexion、HTN、POMDP 在变分自由能与期望自由能的双标量下可比较与可校准,并把"精度"从神经科学假设转为可观测的 inference-time precision proxy。

[slug 候选: active-inference-free-energy-agent-2026]

←返回文章列表

Related

可能也会喜欢

  • Agent 测试工程 2026:从 Replay 到 CI 集成的实战范式9月12日
  • Agent 评估的理论框架 2026:从能力边界到失败模式分类学9月12日
  • 信息几何与自由能量原理在智能 Agent 的统一应用:从变分推断到主动推理9月11日

Conversation

0 条

留下你的想法

加载评论中…

New comment