# 第二章 学习条件分布

《随机鹦鹉解剖学》章节：第二章 学习条件分布。

## Metadata

- HTML: https://glenzli.com/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/ch02-learning-distributions/
- Markdown: https://glenzli.com/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/ch02-learning-distributions.md
- Collection: Dr. Stochastic Parrot
- Language: zh-CN
- Published: 2026-07-17
- Status: published
- Tags: ai-generated, stochastic-parrot, stochastic-parrot-anatomy, ai

## Content

训练不是把每条文本存成“唯一正确答案表”，而是在模型族中寻找一组共享参数，使已观测 token 在各自上下文下获得较高概率。本章区分总体风险、经验风险和实际训练结果，并精确说明“交叉熵学习真实分布”这句话成立所需的条件。

## 2.1 自回归似然与加权经验风险

设训练记录 $i$ 的 token 序列为 $x^{(i)}_{1:T_i}$。自回归模型赋予它的联合概率为

$$
q_\theta(x^{(i)}_{1:T_i})
=\prod_{t=1}^{T_i}
q_\theta(x^{(i)}_t\mid x^{(i)}_{<t}).
$$

设 $w_{it}\ge0$ 且至少一个权重为正。带位置权重的经验负对数似然为

$$
\widehat R_n(\theta)
=-\frac{1}{W}
\sum_{i=1}^n\sum_{t=1}^{T_i}
w_{it}\log q_\theta
(x^{(i)}_t\mid x^{(i)}_{<t}),
\qquad
W=\sum_{i,t}w_{it}.
$$

$w_{it}$ 可以包含 padding mask、来源权重、质量权重或只训练回答区域的 loss mask。目标究竟是按 token、按序列、按来源还是按用户平均，由这些权重决定。

最大化似然与最小化上式等价。对数把序列概率的乘积变成逐位置可加的损失，也避免直接相乘造成数值下溢。

## 2.2 总体风险不是经验风险

若理想化训练位置 $(X,Y)$ 来自分布 $P_{\mathrm{train}}$，总体对数风险为

$$
R(\theta)
=\mathbb E_{(X,Y)\sim P_{\mathrm{train}}}
[-\log q_\theta(Y\mid X)].
$$

$R$ 是关于目标总体的期望，通常不能精确计算；$\widehat R_n$ 是有限数据和实际权重上的可计算量。即使优化器找到

$$
\widehat\theta\in\arg\min_\theta\widehat R_n(\theta),
$$

也不自动得到总体最优参数，更不自动得到部署分布上的最优参数。

二者差异至少来自：

- 有限样本误差与样本依赖；
- 训练数据和目标总体不一致；
- 数据选择与权重估计误差；
- 超参数在验证集上的反复选择；
- 实际优化没有达到经验全局最优。

所以训练 loss、held-out loss 与部署风险是三个不同数值。

## 2.3 对数损失的总体最优性质

先固定一个满足 $P_X(x)>0$ 的上下文 $x$，并设词表有限。记数据条件分布为 $p(\cdot\mid x)$，任意候选预测为 $q(\cdot\mid x)$。条件期望对数损失是

$$
R_x(q)
=-\sum_y p(y\mid x)\log q(y\mid x).
$$

**定理 2.1（对数损失的严格适当性）。** 若 $q(y\mid x)>0$ 对所有 $p(y\mid x)>0$ 成立，则

$$
R_x(q)
=H(p(\cdot\mid x))
+D_{\mathrm{KL}}(p(\cdot\mid x)\Vert q(\cdot\mid x)).
$$

因此 $R_x(q)\ge H(p)$，且等号当且仅当 $q(\cdot\mid x)=p(\cdot\mid x)$。

**证明。** 直接加减 $-\sum_yp(y\mid x)\log p(y\mid x)$，得到

$$
R_x(q)
=-\sum_yp_y\log p_y
+\sum_yp_y\log\frac{p_y}{q_y}.
$$

第一项是熵，第二项是 KL。KL 非负，且在有限分布上仅当 $p=q$ 时为零；证明见[概率附录 A.12](/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/APPENDIX-PROBABILITY/)。证毕。

这一定理支持“对数损失鼓励报告数据条件分布”，但必须保留四个限定：

1. 结论针对 $P_{\mathrm{train}}$，不是未经选择的世界分布；
2. 结论是总体期望，不是单条 one-hot 样本；
3. 模型必须能表示 $p$，才能达到 $q=p$；
4. 优化必须找到相应总体最优，现实训练通常只近似做到。

## 2.4 受限模型族得到的是 KL 投影

设可表示的条件分布集合为

$$
\mathcal Q=\{q_\theta:\theta\in\mathcal T\},
$$

总体最优模型满足

$$
q^*\in\arg\min_{q\in\mathcal Q}
\mathbb E_{X\sim P_X}
D_{\mathrm{KL}}\bigl(P(\cdot\mid X)\Vert q(\cdot\mid X)\bigr).
$$

熵项与 $q$ 无关，因此最小化交叉熵等价于在 $P_X$ 加权下寻找该 KL 投影。若 $P(\cdot\mid x)\notin\mathcal Q$，最优 $q^*$ 一般不等于数据分布。

这个投影还受输入频率加权。高频上下文的 KL 改善可以抵消低频区域的退化；一个较低的总体 loss 不保证每个子群、事实类型或长上下文都改善。

这里的“投影”只是优化问题的简称，不暗示参数空间是欧氏正交投影，也不暗示最优参数唯一。

## 2.5 One-hot 观测与总体多样性不冲突

一次训练位置只观察到 $Y=y$，其标签向量通常是 one-hot。对 logits $z$，单样本交叉熵的导数为

$$
\frac{\partial\ell}{\partial z_k}
=q_\theta(k\mid x)-\mathbf 1\{k=y\}.
$$

它提高已见 token 相对其他 token 的 logit。不同样本和相近上下文可以给出不同后续，共享参数汇总这些梯度。因此：

- 单个位置只说明这次记录出现了什么；
- 样本总体决定各种实现被怎样加权；
- 参数共享决定哪些上下文互相借力；
- 容量与优化决定模型能否分离细微条件。

若同一完整前缀从不重复，就不能用该前缀的直接频率估计条件分布。模型的非退化概率主要来自跨上下文共享结构，而不是每个长字符串都被重复观测。

## 2.6 经验最优也不等于逐上下文频率表

若每个上下文 $x$ 都有一组彼此独立的自由概率参数，则经验对数损失在该上下文上的最优解是经验条件频率。现代语言模型不满足这种分离：同一个权重同时影响大量上下文。

因此降低某个样本损失可能改变许多其他条件分布。有限参数模型是在全局共享约束下折中，而不是逐行复制经验表。正则化、权重绑定和架构等价地限定了可选函数集合。

此外，过参数化模型可能以多个参数向量实现相同或近似相同的 $q$。预测分布可被良好确定，不意味着参数表示可识别。

## 2.7 教师强制改变训练时的输入分布

训练时第 $t$ 步通常条件于数据中的真实前缀：

$$
q_\theta(x_t\mid x_{<t}).
$$

推理时则条件于模型先前产生的随机前缀 $\widehat X_{<t}$。一旦早期选择离开数据常见路径，后续输入可能进入较少受训练约束的区域。

这常被称为 exposure bias，但该术语不是完整解释。长文本退化还可能来自有限上下文、解码截断、训练数据缺少长程结构、检索错误与模型容量。要判定原因，应比较真实前缀评分、自由生成轨迹和首次分歧点，而不是仅引用术语。

## 2.8 数据混合通过期望梯度进入模型

若来源 $s$ 的总体风险为 $R_s(\theta)$，混合权重为 $\lambda_s$，则

$$
R(\theta)=\sum_s\lambda_sR_s(\theta),
\qquad
\nabla R(\theta)=\sum_s\lambda_s\nabla R_s(\theta),
$$

其中交换梯度与期望需要相应可微和可积条件。提高 $\lambda_s$ 会提高该来源的期望梯度权重，但不会使某项能力按同一比例增长：来源梯度可能相互协同、冲突或集中在模型已经拟合的区域。

若训练阶段改变 $\lambda_s(t)$，优化路径还依赖出现顺序。即使最终累计 token 比例相同，课程顺序和优化器状态也可能产生不同参数。

## 2.9 预训练、SFT 与偏好学习在估计不同对象

自回归预训练主要最小化语料 token 的 NLL。监督微调常把指令和理想回答组成模板，并只在回答区域计算

$$
\mathcal L_{SFT}
=-\sum_{t\in\mathcal A}
\log q_\theta(y_t\mid x,y_{<t}).
$$

它同时改变输入条件、数据总体和 loss mask。偏好优化则使用同一提示下的回答比较。例如 DPO 的一个标准形式为

$$
-\log\sigma\!\left(
\beta\left[
\log\frac{q_\theta(y^+\mid x)}{q_{ref}(y^+\mid x)}
-
\log\frac{q_\theta(y^-\mid x)}{q_{ref}(y^-\mid x)}
\right]
\right).
$$

它不估计开放文本的唯一“真实回答分布”，而是在参考模型、偏好采集策略和成对损失规定下重新分配序列概率。相同偏好对在不同参考模型或 $\beta$ 下可产生不同最优策略。

卷一讨论这些方法的训练工程；本章只强调它们对应不同统计目标，不能把后训练模型的概率继续解释为原始网页分布的无偏估计。

## 2.10 平滑与正则化改变目标或解空间

以 $K$ 类 label smoothing 为例，给定 $0\le\varepsilon\le1$，one-hot 目标被改为

$$
p^{(\varepsilon)}
=(1-\varepsilon)e_y+
\varepsilon\frac{\mathbf 1}{K}.
$$

这时严格最优预测对应平滑后的标签分布，而非原 one-hot 条件分布。它可能减少极端 logit，却不从公式上保证部署校准改善。

weight decay 主要改变参数解的偏好；dropout 同时引入训练算法随机性并改变期望目标；数据增强则改变输入与标签的联合分布。把它们都称为“防止过拟合”会掩盖机制差异。

## 2.11 支持外行为不由训练风险识别

设训练输入只落在集合 $S$。若两个模型 $q_1,q_2$ 对所有 $x\in S$ 都相同，却在 $x\notin S$ 时任意不同，则它们具有相同训练总体风险：

$$
R(q_1)=R(q_2).
$$

训练分布上的似然无法区分二者。模型在支持外的具体输出来自函数类、预训练迁移、正则化与优化选择，而不是由该训练风险唯一识别。

这给出一个重要反例：即使我们拥有无限多的 $P_{\mathrm{train}}$ 样本并精确优化，也不能仅凭这些数据保证任意分布外任务。更多同分布数据减少估计误差，不会自动消除目标错设和支持缺失。

## 2.12 损失改善能推出什么

在统一 tokenizer、文本规范化和评测分布下，更低 held-out NLL 表示模型给实际观测 token 的平均对数概率更高。这是明确且重要的概率结论。

它不单独推出：

- 事实正确率更高；
- 开放回答更符合人类偏好；
- 长程一致性或工具调用改善；
- 概率已经校准到命题正确率；
- 分布外鲁棒性提高；
- 因果或机制理解更接近人类。

这些性质需要各自的事件定义、标签与实验设计。指标间可能相关，但相关性必须测量，不能由训练公式补写出来。

## 2.13 本章结论

对数损失在总体、可表示和可优化的理想条件下严格鼓励报告数据条件分布；受限模型得到的是由输入频率加权的 KL 最优近似。现实训练还隔着有限样本、参数共享、正则化与随机优化。预训练、SFT 和偏好学习改变的是不同目标分布或风险函数。下一章进入模型输出层，研究这些学习结果如何表现为 logit 赔率、token 概率、序列概率与语义事件质量。
