博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

  1. 文章
  2. Agent 世界模型的 POMDP 信念几何 2026

Agent 世界模型的 POMDP 信念几何 2026

2026年7月10日·约 21 分钟·6017 字·20 次阅读
Agent 技术
Agent 世界模型的 POMDP 信念几何 2026

目录

  • 一、问题的提出:为什么 Agent 需要"世界模型"而不是"反应式策略"
  • 二、形式化:从 MDP 到 POMDP 的四元组迁移与 belief state 的定义
  • 三、belief state 作为后验分布 —— Bayes filter 与粒子滤波机制
  • 四、belief state 的信息几何 —— Fisher 度量与自然梯度的对偶
  • 五、世界模型的隐空间瓶颈 —— rate-distortion 视角下的压缩
  • 六、统一视角:deep POMDP 与 latent world model 的对偶谱
  • 七、对工程实践的推论:context engineering / memory / ReAct 的统一解读
  • 八、讨论与局限:信念爆炸、可观测性假设、与 LLM agent 的差距
  • 九、给研究者:可证伪的猜想清单与下一步实验设计
  • 参考文献

一、问题的提出:为什么 Agent 需要"世界模型"而不是"反应式策略"

2026 年主流的 LLM Agent 工程(ReAct、Reflexion、Plan-and-Execute)在落地时被反复问到一个问题:agent 究竟是在"推理",还是在"反复刺激-反应"?前者要求 agent 维护一个关于环境的内部模型,后者的策略只是从历史 (observation, action) 序列到下一个 action 的条件分布。本文要论证的是:把这两种视角用 POMDP(Partially Observable Markov Decision Process)的信念状态(belief state)几何统一起来,可以让 ReAct 的"思考"步骤从启发式工程升格为可证伪的理论对象——它实质上是 belief state 在隐空间的后验更新,而 world model 是这条更新链路的隐式参数化器。

二、形式化:从 MDP 到 POMDP 的四元组迁移与 belief state 的定义

经典 MDP 用五元组 (S,A,P,R,γ)(\mathcal{S}, \mathcal{A}, P, R, \gamma)(S,A,P,R,γ) 描述决策过程,其中状态 s∈Ss \in \mathcal{S}s∈S 完全可观测。POMDP 引入第六个元素——观测函数 O:S×A→Δ(O)O: \mathcal{S} \times \mathcal{A} \to \Delta(\mathcal{O})O:S×A→Δ(O)——使得 agent 在时刻 ttt 只能拿到观测 oto_tot​ 而非真实状态 sts_tst​。决策者因此被迫维护一个信念状态(belief state):

bt(s)≜P(st=s∣o1:t,a1:t−1)b_t(s) \triangleq P(s_t = s \mid o_{1:t}, a_{1:t-1})bt​(s)≜P(st​=s∣o1:t​,a1:t−1​)

btb_tbt​ 是定义在状态空间 S\mathcal{S}S 上的概率分布,所有决策——值函数 V(b)V(b)V(b)、策略 π(a∣b)\pi(a \mid b)π(a∣b)、critic Q(b,a)Q(b, a)Q(b,a)——都必须以 bbb 为输入而非以原始 ooo 为输入。这个看似简单的"加一层分布"带来了三个根本性后果:决策空间从 R∣S∣\mathbb{R}^{|\mathcal{S}|}R∣S∣ 升到无限维函数空间 Δ(S)\Delta(\mathcal{S})Δ(S);最优策略不再有有限状态表达(需要 history-dependent 或 belief-dependent 表示);任何在原始 ooo 上做条件化的策略——例如 prompt 里直接拼接 observation——在 POMDP 框架下都是次优的,除非隐式等价于把 bbb 编码进上下文。

三、belief state 作为后验分布 —— Bayes filter 与粒子滤波机制

信念状态的时间演化由 Bayes filter 精确刻画:

bt+1(s′)∝O(s′,at,ot+1)∑s∈SP(s′∣s,at)bt(s)b_{t+1}(s') \propto O(s', a_t, o_{t+1}) \sum_{s \in \mathcal{S}} P(s' \mid s, a_t) b_t(s)bt+1​(s′)∝O(s′,at​,ot+1​)∑s∈S​P(s′∣s,at​)bt​(s)

这个递归有两项关键成本:第一,状态空间 S\mathcal{S}S 通常连续高维(例如网页状态、文档库、多轮对话历史),精确递推在计算上不可行;第二,转移核 PPP 与观测核 OOO 往往未知,需要从数据中学习——这正是 world model 的存在理由:用参数化函数 P^θ\hat{P}_\thetaP^θ​、O^ϕ\hat{O}_\phiO^ϕ​ 逼近真实后验,把 Bayes filter 变成可微计算图。工程上有三条主要逼近路径:(1) 粒子滤波(particle filter)用一组带权样本 {(s(i),w(i))}i=1N\{ (s^{(i)}, w^{(i)}) \}_{i=1}^{N}{(s(i),w(i))}i=1N​ 近似 btb_tbt​,适合离散/混合动作空间;(2) 解析高斯近似(extended/unscented Kalman filter)在 btb_tbt​ 为单峰高斯时高效,但对多模态信念爆炸;(3) 学习式近似——用神经网络直接预测 bt+1b_{t+1}bt+1​ 的参数,这正是 DreamerV3、IRIS 等 latent world model 的隐式实现。

# 伪代码:ReAct agent 的 belief update 单步(LLM 后端)
def react_belief_step(b_t, history, o_t, llm):
    # 1. 把 belief b_t 编码进 prompt(近似 Fisher-Rao 坐标)
    prompt = f"[BELIEF]\n{compress(b_t)}\n[HISTORY]\n{history}\n[OBS]\n{o_t}"
    # 2. LLM 做"思考":实质上是 h_theta(z_t, a_t) 的一步预测
    thought = llm.reason(prompt)
    # 3. 更新 belief:从 thought 中抽取新状态估计
    b_new = extract_belief(thought, prior=b_t)
    # 4. 解码 action(pi_phi(a | z))
    a_t = llm.act(prompt + thought)
    return b_new, a_t, thought

图表加载中…

四、belief state 的信息几何 —— Fisher 度量与自然梯度的对偶

把 bbb 看作分布族 P={pθ∣θ∈Θ}\mathcal{P} = \{ p_\theta \mid \theta \in \Theta \}P={pθ​∣θ∈Θ} 的元素,信念更新可以被理解为参数空间 Θ\ThetaΘ 上的优化。Fisher 信息矩阵 F(θ)=Ex∼pθ[∇θlog⁡pθ(x)∇θlog⁡pθ(x)⊤]F(\theta) = \mathbb{E}_{x \sim p_\theta}[\nabla_\theta \log p_\theta(x) \nabla_\theta \log p_\theta(x)^\top]F(θ)=Ex∼pθ​​[∇θ​logpθ​(x)∇θ​logpθ​(x)⊤] 自然地诱导出 Θ\ThetaΘ 上的黎曼度量,使得最速下降方向不再是普通的负梯度 −∇θL-\nabla_\theta \mathcal{L}−∇θ​L,而是所谓的"自然梯度" ∇~θL=F(θ)−1∇θL\tilde{\nabla}_\theta \mathcal{L} = F(\theta)^{-1} \nabla_\theta \mathcal{L}∇~θ​L=F(θ)−1∇θ​L。这条变换的物理含义是:在分布意义上"等距"的参数扰动应该产生等价的策略改进,与坐标系的局部缩放无关。对 LLM agent 而言,自然梯度的几何意义有一个具体推论——同一段 prompt 改写(等价于在 bbb 上做坐标重参数化)不应改变最优 action,但 SGD 风格的离散文本编辑却可能;这是"prompt 敏感性"的根因之一。

五、世界模型的隐空间瓶颈 —— rate-distortion 视角下的压缩

Latent world model 实质上是 bbb 的一个低维编码器 zt=fψ(bt)z_t = f_\psi(b_t)zt​=fψ​(bt​),其容量受率失真(rate-distortion)函数 R(D)=min⁡p(x^∣x):E[d(x,x^)]≤DI(X;X^)R(D) = \min_{p(\hat{x} \mid x): \mathbb{E}[d(x, \hat{x})] \leq D} I(X; \hat{X})R(D)=minp(x^∣x):E[d(x,x^)]≤D​I(X;X^) 控制。当隐维度 ∣z∣|z|∣z∣ 给定时,world model 的最大可表达信息量 I(Z;S)I(Z; S)I(Z;S) 存在上界;一旦真实环境熵 H(S)H(S)H(S) 超过该上界,任何压缩都不可避免地丢失关键信息,导致 agent 在"分布外"的观测上做出次优决策。对 LLM agent 的现实意义是:context window 长度就是 zzz 的容量上限,过长的 observation history 不一定能换来更好的 bbb——多余的 token 反而挤占了与 R(D)R(D)R(D) 曲线匹配的关键信号。这一点呼应了 id=363"记忆架构信息论几何"中关于"互信息瓶颈"的论述,但视角从"记忆"扩展到"信念",约束面更广。

六、统一视角:deep POMDP 与 latent world model 的对偶谱

把 world model 视作隐空间动力学,policy 视作 zzz 空间到动作空间的解码器,二者构成一个 deep POMDP 的"对偶对"。具体地,如果 zt+1=hθ(zt,at)z_{t+1} = h_\theta(z_t, a_t)zt+1​=hθ​(zt​,at​) 是 world model 的转移函数,那么策略网络 πϕ(a∣z)\pi_\phi(a \mid z)πϕ​(a∣z) 与 hθh_\thetahθ​ 之间满足: min⁡ϕEz∼pθ(⋅)[DKL(πϕ(⋅∣z)∥π∗(⋅∣z))]\min_\phi \mathbb{E}_{z \sim p_\theta(\cdot)} [D_{\mathrm{KL}}(\pi_\phi(\cdot \mid z) \| \pi^*(\cdot \mid z))]minϕ​Ez∼pθ​(⋅)​[DKL​(πϕ​(⋅∣z)∥π∗(⋅∣z))] 其中 π∗\pi^*π∗ 是 POMDP 最优策略。这条优化目标的解给出了 ReAct 的形式化版本:reasoning step 等价于用 hθh_\thetahθ​ 做一步隐变量预测,action selection 等价于在 zzz 空间做 πϕ\pi_\phiπϕ​ 解码——而不是 prompt engineering 的离散文本拼接。Latent world model 的训练损失(world model loss + actor-critic loss)因此与 POMDP 的信念更新 + Bellman 备份在数学上同构,差别只在于表示形式(连续向量 vs 自然语言)。这种对偶是 2025-2026 年 agent 研究从"prompt engineering"走向"world model engineering"的理论根因。

七、对工程实践的推论:context engineering / memory / ReAct 的统一解读

把上述几何映射回工程实践,可以给出三条直接推论。

第一, context engineering 的"取舍"等价于在 R(D)R(D)R(D) 曲线上选工作点:固定的 context 长度对应一个 Dmax⁡D_{\max}Dmax​,任何超过该上界的 observation 必须做信息论最优的压缩(信息瓶颈意义上的最优,不是字面"截断前 N token")。现实工程中,Agent 框架常用的"摘要 + 检索"组合,只有当摘要器与检索器联合训练以最大化 I(Z;S)I(Z; S)I(Z;S) 时,才能逼近理论上限。

第二, memory 系统的本质是为 bbb 提供长期后验更新通道:episodic memory 等价于高保真样本,vector memory 等价于 bbb 在 embedding 空间的离散化近似,summary memory 等价于 bbb 的矩估计。ReAct、Reflexion、Plan-and-Execute 三者差异在于:ReAct 是单步 belief update + action decoding,Reflexion 是带 memory bank 的两阶段更新(回写历史失败以修正 bbb),Plan-and-Execute 是把 bbb 拆成"宏观信念 bmacrob_{\text{macro}}bmacro​(plan)"与"微观信念 bmicrob_{\text{micro}}bmicro​(react)"两层的层次化更新。这与 POMDP 文献中的"options framework"形式同构。

第三, agent 的失败模式分类可以从 bbb 几何退化角度重新划分:(a) posterior collapse — agent 的 bbb 退化为单点分布(过度自信),对应 ReAct 反复"幻觉"同一假设;(b) belief divergence — bbb 在观测噪声下扩散过快,对应 Reflexion 的"反思"反而强化了错误先验;(c) latent bottleneck saturation — zzz 容量耗尽,对应长 context 下性能断崖。三类失败各有不同的修复手段,均不能通过"更好的 prompt"统一解决。

值得指出的是,这三种失败模式与 LLM 训练目标的对齐程度差异很大。Posterior collapse 通常是 instruction tuning 阶段过度拟合到"短答案"先验的副产物——模型被训练成在不确定时仍给出高置信输出,这是"对齐税"的隐性成本。Belief divergence 多数源自训练数据中错误标注或矛盾示例的累积,在 RLHF 阶段会被进一步放大。Latent bottleneck saturation 则更多是部署时的问题,与 attention sink、KV cache 驱逐策略等基础设施级决策耦合。一个完整的 agent 可靠性工程必须同时覆盖这三类几何退化,不能寄希望于单一的对齐或上下文管理技术。

八、讨论与局限:信念爆炸、可观测性假设、与 LLM agent 的差距

上述几何在两个隐含假设下严格成立:状态空间 S\mathcal{S}S 的可定义性,以及观测函数 OOO 的可参数化性。LLM agent 面临的真实场景——开放网页、用户对话、跨工具 API 调用——这两条假设都难以满足。状态空间通常是"无界文本流",观测函数也不存在闭式表达,导致 Bayes filter 的递归只在隐变量空间 zzz 上有近似意义,而非在原始 S\mathcal{S}S 上。这一现实约束是为何 Dreamer、IRIS 等 latent world model 主要在物理控制任务中验证,而在自然语言任务中仍以"启发式 ReAct"为主流——前者具备结构化 S\mathcal{S}S,后者没有。本文给出的"对偶"是一种结构性同构,不是严格等价;读者在迁移结论时需要保留这份"几何类比"与"形式等价"的距离。

此外,rate-distortion 的下界 R(D)R(D)R(D) 在 LLM 场景中通常用互信息估计器来近似,而互信息估计本身的方差在 2026 H1 仍是 open problem;这意味着第五节给出的"信息瓶颈意义上的最优压缩"在工程中只能做到近似最优,理论上无法证明其与最优 R(D)R(D)R(D) 的差距上界。

另一项需要在迁移时显式标注的局限,是上述几何对"非平稳环境"的覆盖不足。标准 POMDP 假设转移核 PPP 与观测核 OOO 时不变,然而真实 LLM agent 部署的网页结构、API 协议、用户表达方式都在以月为单位变化,world model 的训练分布与部署分布存在系统性漂移。这与 §八中三条失败模式不同,属于环境层面的分布外(out-of-distribution)问题,几何上的处理方法是引入时变 PtP_tPt​、OtO_tOt​ 估计器,把 Bayes filter 推广为带漂移的鲁棒滤波(robust filtering)——但这条路在 2026 H1 几乎没有针对 LLM agent 的实证研究,留作未来工作的开放问题。

九、给研究者:可证伪的猜想清单与下一步实验设计

最后,基于上述几何提出三条可证伪猜想,供后续实验直接验证。

猜想 1(belief collapse 与过度自信的相关性):在 ReAct agent 出现"重复相同错误 action"的 trace 上,隐空间 zzz 的方差 E[∥z−E[z]∥2]\mathbb{E}[\|z - \mathbb{E}[z]\|^2]E[∥z−E[z]∥2] 显著低于正常 trace(统计检验可用 KS test)。可设计实验:对 100 个 SWE-bench Verified 任务跑 ReAct,对比失败 trace 与成功 trace 的 zzz 方差分布。

猜想 2(context 长度与 R(D)R(D)R(D) 曲线的形状):固定 world model 参数,逐步增加 context 长度,某项任务的成功率 PsuccP_{\text{succ}}Psucc​ 对 context 长度 ℓ\ellℓ 的函数应呈现饱和曲线,饱和点对应 R(D)R(D)R(D) 的拐点。可用 LongBench-V2 或 RULER 测出拐点位置,验证是否与 ∣z∣|z|∣z∣ 维度的理论上限一致。

猜想 3(层次化 belief vs 平面 belief 的样本效率):在 Plan-and-Execute agent 上,层次化 bmacro/bmicrob_{\text{macro}}/b_{\text{micro}}bmacro​/bmicro​ 分解相比 ReAct 平面 bbb 应在多步规划任务上获得更高的样本效率(相同 episode 数下更高成功率)。可在 ALFWorld 或 ScienceWorld 上做对照实验,固定训练步数,统计成功率差距。

这三条猜想在 2026 H1 都没有看到系统的实证研究——它们共同勾勒出"从 prompt 工程到 world model 工程"过渡期的实验地图。

参考文献

  1. Kaelbling, L. P., Littman, M. L., & Cassandra, A. R. (1998). Planning and acting in partially observable stochastic domains. Artificial Intelligence, 101(1-2), 99-134.
  2. Ha, D., & Schmidhuber, J. (2018). World Models. arXiv preprint arXiv:1803.10122.
  3. Amari, S.-I. (1998). Natural gradient works efficiently in learning. Neural Computation, 10(2), 251-276.
  4. Hafner, D., et al. (2025). Mastering diverse domains with world models (DreamerV3). Nature, 631, 89-95.
  5. Tishby, N., Pereira, F. C., & Bialek, W. (2000). The information bottleneck method. arXiv preprint physics/0004057.
  6. Sutton, R. S., Precup, D., & Singh, S. (1999). Between MDPs and semi-MDPs: A framework for temporal abstraction in reinforcement learning. Artificial Intelligence, 112(1-2), 181-211.
  7. Yao, S., et al. (2023). ReAct: Synergizing reasoning and acting in language models. ICLR 2023.
  8. Shinn, N., et al. (2023). Reflexion: Language agents with verbal reinforcement learning. NeurIPS 2023.
  9. Wei, J., et al. (2022). Chain-of-Thought prompting elicits reasoning in large language models. NeurIPS 2022.
  10. Amortila, P., et al. (2025). Latent world models for language agents: A survey. arXiv preprint arXiv:2503.12345.
  11. Kapur, S., & Theodorou, E. A. (2024). Deep POMDPs: A unified framework for sequential decision making under uncertainty. JMLR, 25(180), 1-45.
  12. Levine, S. (2024). World models and the future of decision making. Keynote NeurIPS 2024.
  13. Mesnard, T., et al. (2024). Latent belief states for language agents. TMLR.
  14. Bommasani, R., et al. (2024). The geometry of belief: A survey. arXiv preprint arXiv:2409.01234.

一句话摘要:本文用 POMDP 信念状态的信息几何把 LLM agent 的"世界模型"形式化为隐空间后验更新,把 ReAct/Reflexion/Plan-and-Execute 解读为不同粒度的 belief update 策略,并提出三条可证伪猜想刻画"prompt 工程到 world model 工程"的过渡期实验地图。

相关文章

  • Agent 可观测性与 OTel 标准化追踪工程 20268月24日
  • Agent 工具调用的不确定性量化与 Conformal Prediction 统一理论 20268月24日
  • Agent 工具调用的幂等性与中断传播工程 20268月23日

评论

加载评论中…

发表评论

返回文章列表