# 第零章 为什么确定的机器仍使用概率语言

Chapter from the Chinese-language book Anatomy of the Stochastic Parrot: 第零章 为什么确定的机器仍使用概率语言.

## Metadata

- HTML: https://glenzli.com/en/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/ch00-why-probability/
- Markdown: https://glenzli.com/en/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/ch00-why-probability.md
- Collection: Dr. Stochastic Parrot
- Language: en
- Published: 2026-07-17
- Status: published
- Tags: ai-generated, stochastic-parrot, stochastic-parrot-anatomy, ai

## Content

一块数字芯片可以按确定指令运行，固定权重的神经网络也可以把固定输入确定地映射为 logits。语言模型仍然使用概率，并不是因为每次前向传播都必然含有随机过程，而是因为模型所描述的对象、训练所见的数据、训练算法的输出和部署时的执行分别处在不同层次。本章先把这些层次分开；后续所有公式都以此为约束。

## 0.1 确定计算可以表示概率分布

设参数为 $\theta$，模型实际可见的上下文为 $x$，词表为有限集 $V$。前向网络计算

$$
z=f_\theta(x)\in\mathbb R^{|V|},
$$

再由 softmax 得到

$$
q_\theta(v\mid x)
=\frac{\exp z_v}{\sum_{u\in V}\exp z_u}.
$$

只要 $\theta$、$x$、算子实现和数值环境固定，$z$ 与 $q_\theta$ 都可以是确定量。概率向量是一次确定计算的输出。只有执行

$$
Y\sim q_\theta(\cdot\mid x)
$$

时，采样器才为这次运行消费随机数。因此必须区分：

1. 模型**表示**条件分布；
2. 解码算法**使用**条件分布；
3. 一次运行**实现**其中一条路径。

第一项不要求运行随机；第三项即使随机，也不保证第一项正确描述数据，更不保证它是真实世界事件的概率。

## 0.2 概率对象的六层账本

本卷使用以下六层，而不把它们统称为“模型置信度”。

| 层次 | 典型对象 | 随机变量是什么 | 主要问题 |
|---|---|---|---|
| 世界与任务 | $P_W(Y\mid X,H)$ | 事件、行动或人类表达 | 完整情境下是否仍有多解 |
| 观测与数据 | $P_D(X,Y)$ | 被记录并进入数据的样本 | 选择、时间、来源和标注怎样重加权 |
| 学得模型 | $q_\theta(Y\mid X)$ | 模型定义的 token 或序列 | 训练目标把什么投影到模型族中 |
| 训练运行 | $\Theta=A(S,\Omega)$ | 算法最终产生的参数 | seed、数据顺序和数值执行怎样造成模型间差异 |
| 解码输出 | $Y_{\mathrm{dec}}\sim K_{\theta,\delta}(\cdot\mid X)$ | 解码器产生的 token 路径或文本 | 温度、截断、约束和停止规则怎样改变分布 |
| 完整系统 | $Y_{\mathrm{sys}}\sim P_{\mathrm{sys}}(\cdot\mid r)$ | 用户可见结果、工具结果或失败 | 路由、过滤、工具和系统状态怎样继续改变分布 |

这里 $\delta$ 表示解码协议；$K_{\theta,\delta}$ 是固定模型经该协议诱导的解码分布，通常不等于基础模型的 $q_\theta$。版本化请求 $r$ 还固定服务版本、路由、过滤、工具与失败处理；$P_{\mathrm{sys}}(\cdot\mid r)$ 才是相应的系统可观察分布。若某一实现把过滤器并入“解码器”，必须明确重新声明 $\delta$ 的边界，不能在推导中悄悄改变对象。

一个合格的概率陈述至少要注明层次。例如，“答案 A 的概率为 0.7”仍然缺少模型版本、实际输入、事件定义、解码前后位置与目标总体，因而不是可复核结论。

## 0.3 可见输入压缩了隐上下文

给定前缀“会议结束后，他”，人物身份、会议结果、作者目的和文体没有完全给出。把模型可见条件记为 $X$，未见但影响输出的条件记为 $H$，则

$$
P_D(Y=y\mid X=x)
=\int P_D(Y=y\mid X=x,H=h)\,dP_D(h\mid x).
$$

即使对每个完整状态 $(x,h)$，结果都由某个函数 $Y=g(x,h)$ 唯一确定，隐藏 $H$ 后的条件分布仍可非退化。概率在这里描述相对于可见信息的粗粒化，不对世界是否在形而上意义上决定论作结论。

增加上下文、检索结果、图像或工具状态，相当于把一部分 $H$ 移入可见条件。条件分布随之改变：

$$
P_D(Y\mid X=x)
\quad\text{与}\quad
P_D(Y\mid X=x,H_1=h_1)
$$

不是同一个概率对象。所谓“模型本身对这个问题的概率”若不固定完整输入，并不存在唯一数值。

## 0.4 观测分布不识别不确定性的本体来源

同一个观测分布可以由不同隐机制产生。考虑 $Y\in\{0,1\}$ 且 $P(Y=1)=1/2$：

- 机制 A：每次由不可再约减的 Bernoulli 抽样产生 $Y$；
- 机制 B：先取未观测 $H\sim\operatorname{Bernoulli}(1/2)$，再令 $Y=H$，给定 $H$ 后完全确定。

只观察 $Y$ 时，两种机制给出完全相同的分布。没有关于 $H$ 的额外观测、干预或结构假设，就不能从 $P(Y)$ 判断不确定性究竟“本体随机”还是“隐藏条件造成”。

这是一条识别边界，而不只是措辞谨慎：概率分布决定可观测事件的质量，却不唯一决定其潜在生成故事。大模型从文本分布学习，也不会仅凭似然自动恢复唯一的世界机制。

## 0.5 四类变异必须分开

本卷将容易混淆的现象分成四类。

### 数据或条件内不确定性

在所采用的条件粒度下，$P_D(Y\mid X=x)$ 仍允许多个结果。它可能来自语言多解、标签分歧、隐上下文混合或观测噪声。它总是相对于“哪些变量已纳入条件”而言。

### 模型或参数不确定性

有限数据、模型族限制和优化路径使 $q_\theta$ 偏离目标分布。若把训练运行的参数写成随机变量 $\Theta$，不同 $q_\Theta$ 之间的差异属于模型间变异。单个 checkpoint 的 softmax 不自动给出 $P(\Theta\mid D)$。

### 随机算法

训练洗牌、dropout、初始化和推理解码会显式读取伪随机状态。给定完整随机状态后，算法通常仍可视为确定映射。随机算法描述的是执行机制，不是预测是否正确。

### 系统非确定性

并行归约、动态批处理、竞态、滚动部署、缓存与外部工具可能使相同请求返回不同结果，即使调用者固定了 seed。这类变异有时能用随机模型估计，但其工程来源不应被误称为模型的“认知不确定性”。

文献常用 aleatoric 与 epistemic 对应前两类。对大模型，这组词只有在条件集、数据总体和模型集合明确时才有意义；它不覆盖随机算法与服务环境的全部差异。

## 0.6 三个反例

**反例一：输出变化不推出模型变化。** 固定 checkpoint，用 top-p 独立采样两次得到不同句子，只说明部署运行选择了不同路径；参数可以逐位相同。

**反例二：输出稳定不推出知识确定。** greedy decoding 每次返回同一错误答案，消除了采样变化，却没有消除数据偏差、模型误差或条件缺失。

**反例三：模型变化不推出行为显著变化。** 两次训练得到不同参数向量，可能在目标输入总体上给出近乎相同分布；神经元置换等参数对称性也能产生不同权重表示而保持函数不变。

因此，“随机”“不确定”“不可复现”和“错误”是四个不同概念。它们可以同时出现，但不存在两两等价关系。

## 0.7 概率语言能回答什么

定义事件、条件与总体后，概率语言允许我们：

- 比较候选 token 或序列的相对支持；
- 用对数似然和 proper scoring rule 训练、评估概率预测；
- 分析熵、校准、选择性风险与决策损失；
- 描述解码器怎样重新分配或删除概率质量；
- 用重复实验估计运行内和运行间变异；
- 明确结论依赖的抽样、独立性与分布假设。

它不自动提供：

- 事实真值或证据来源；
- 隐变量机制的唯一分解；
- 现实世界的因果方向；
- 单个开放回答正确性的认证；
- 对训练支持之外输入的保证；
- 应采取何种行动的价值判断。

## 0.8 阅读本卷时的声明格式

后文将反复使用以下最小声明：

> 在输入总体 $P_X$、版本化模型或系统 $M$、明确标注的概率对象 $Q$（基础模型 $q_\theta$、解码分布 $K_{\theta,\delta}$ 或完整系统分布 $P_{\mathrm{sys}}(\cdot\mid r)$）及事件映射 $g$ 下，估计或分析随机变量 $g(Y)$ 的某个函数。

它迫使分析者回答五个问题：总体是什么、条件是什么、分布位于哪一层、文本怎样映射为事件、数值要支持什么结论。缺少其中任一项，公式可能正确，解释仍可能错误。

## 0.9 本卷路线

第一章从世界、记录过程与隐上下文进入观测分布；第二章说明交叉熵在什么条件下学习分布，以及有限数据和受限模型族改变了什么；第三、四章研究 logits、序列事件与解码诱导分布；第五章区分训练随机性、参数变异和系统非确定性；第六章处理 proper score、校准、语义不确定性和选择性预测；第七章给出 Monte Carlo、配对比较与漂移分析的实验方法；第八章集中陈述可识别边界。

需要复习条件概率、方差、Monte Carlo、区间估计或 KL 的读者，可先读[概率基础的最小工具箱](/en/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/APPENDIX-PROBABILITY/)。正文不会重复一般概率论教材，只在公式能直接约束模型概率解释时引入它。
