Chain-of-Thought 的图基推理理论 2026:可达性与图采样下界
把 CoT 重新形式化为推理图 G=(V,E,W),本文用可达性测度、组合复杂度与图采样下界三件套,统一解释 CoT 有效性,并给出三条未公开验证的猜想。
- #大模型研究
Archive
97 篇文章
切换标签
把 CoT 重新形式化为推理图 G=(V,E,W),本文用可达性测度、组合复杂度与图采样下界三件套,统一解释 CoT 有效性,并给出三条未公开验证的猜想。
DeepSeek 抛出的 NSA 把 attention 的接受域切成了可学习的压缩/选择/滑动窗三分支。本文用 metric-measure 空间给出五条主定理(紧化存在性、压缩不动点、稀疏率相变、与 Mamba-2 SSD 的对偶谱、与 GQA/MQA 的几何包含),并画出两条训练动力学相变曲线,给研究者五条未公开验证的几何猜想与一份八项工程基线。
本文用统计场论重新推导课程学习,把课程温度 τ 与泛化误差的耦合刻画为亚临界-临界-超临界三段式相变,给出临界温度 τc 的封闭形式、盆地连通性的相变诊断,以及 SRE 训练平台可观测性的三组新指标。