# 第一章 世界、数据与隐上下文

《随机鹦鹉解剖学》章节：第一章 世界、数据与隐上下文。

## Metadata

- HTML: https://glenzli.com/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/ch01-world-data-hidden-context/
- Markdown: https://glenzli.com/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/ch01-world-data-hidden-context.md
- Collection: Dr. Stochastic Parrot
- Language: zh-CN
- Published: 2026-07-17
- Status: published
- Tags: ai-generated, stochastic-parrot, stochastic-parrot-anatomy, ai

## Content

模型不会直接学习“世界本身的概率”。它接触的是被记录、发布、抓取、过滤、去重、切分并按训练配方采样的数据。要解释模型为何给某些 token 较高概率，必须先明确数据分布怎样从世界过程产生，以及哪些条件在进入模型前已被丢失。

## 1.1 从世界事件到训练记录

设 $W$ 表示世界状态和参与者目的，$R$ 表示记录与发布，$S$ 表示采集和筛选，$T$ 表示分词与样本构造。可以把数据管线写成

$$
W\longrightarrow R\longrightarrow S\longrightarrow T(D).
$$

模型训练直接作用于最终记录 $T(D)$。网页发布倾向、抓取范围、语言覆盖、许可、质量过滤器、去重和 tokenizer 都介入了该过程。因此至少要区分：

$$
P_W,
\qquad P_R,
\qquad P_D,
\qquad P_{\mathrm{train}}.
$$

$P_W$ 是研究者希望谈论的世界或任务总体；$P_R$ 是可被记录和发布的总体；$P_D$ 是数据管线保留的总体；$P_{\mathrm{train}}$ 是训练采样器实际赋权的分布。它们一般不相等。

为刻画从世界总体到保留样本的一次选择，将 $(X,Y,S)$ 的联合律记为 $P$，并令其 $(X,Y)$ 边缘为 $P_W$。若样本被保留的事件为 $S=1$，则在密度或离散质量有定义处

$$
P_D(x,y)
=P(x,y\mid S=1)
=\frac{P(S=1\mid x,y)P_W(x,y)}{P(S=1)}.
$$

若保留概率依赖 $x$ 或 $y$，选择就会改变分布。“数据里常见”只意味着在这条观测和筛选机制下常见，不能无条件推出在世界人口、真实事件或价值判断中常见。

## 1.2 可见条件与隐条件

把模型可见输入记为 $X$，未输入但影响结果的变量记为 $H$，目标记为 $Y$。模型从数据中可直接拟合的是边缘化后的条件分布

$$
P_D(Y\in A\mid X=x)
=\int P_D(Y\in A\mid X=x,H=h)\,dP_D(h\mid x).
$$

$H$ 可以包括作者身份、日期、地点、未写出的前文、真实意图、编辑规范、感官状态或外部工具结果。两个表面相同的提示可能对应不同 $H$，因而产生不同合理回答。

长上下文、检索和多模态输入的一个作用，是把原先隐藏的部分状态显式提供给模型。但只有当新增变量与结果相关、被正确观测且被模型有效使用时，条件不确定性才可能下降；加入无关或错误检索也可能使预测更差。

## 1.3 隐机制不可由边缘分布唯一识别

以下命题说明为什么“概率来自哪里”不能只靠最终频率回答。

**命题 1.1（潜在分解不唯一）。** 给定任意有限结果分布 $p(y)$，至少存在两类生成机制产生同一边缘分布：一类直接令 $Y\sim p$；另一类先令隐藏变量 $H\sim p$，再确定地设置 $Y=H$。

**证明。** 第一类机制按定义给出 $P(Y=y)=p(y)$。第二类机制满足

$$
P(Y=y)=\sum_h\mathbf 1\{y=h\}P(H=h)=p(y).
$$

两者对 $Y$ 的所有可观测事件给出相同概率，但给定隐藏状态后的条件分布不同。证毕。

这个简单构造已经足以反驳一种常见推断：仅由模型或数据的高熵，不能识别世界是否含有不可约随机性。要区分隐状态混合、测量误差与真正随机机制，必须增加变量、实验或结构假设。

## 1.4 条件分布只在数据支持上受约束

概率论中的条件分布 $P_D(Y\mid X=x)$ 通常只在 $P_D^X$ 几乎处处的意义下唯一。对 $P_D^X(x)=0$ 的输入，观测分布本身不规定条件概率。

离散情形很直观：若训练总体从未出现上下文 $x^*$，则联合分布给出 $P_D(X=x^*,Y=y)=0$，不能用比值定义 $P_D(Y\mid X=x^*)$。模型仍会输出 $q_\theta(\cdot\mid x^*)$，但这是架构、参数共享和优化偏置所作的外推，不是由该位置的数据频率识别出的条件分布。

即使 $x$ 在支持内，精确长前缀往往只出现一次。语言模型不是为每个完整字符串建立独立频数表，而是利用参数共享把不同上下文联系起来。哪些上下文被视为相似，是模型归纳偏置的一部分。

## 1.5 自然语言不是唯一标签任务

开放式语言通常允许多个事实等价的措辞、不同详略、不同礼貌程度与不同推理路径。若把任务接受的输出集合记为 $A(x)$，训练语料常只给出一个实现 $y\in A(x)$，而没有枚举整个集合。

这产生两个不同对象：

$$
P_D(Y=y\mid X=x)
\quad\text{与}\quad
P_D(Y\in A(x)\mid X=x).
$$

前者是某个字符串或 token 序列的质量；后者是由外部任务规则聚合的事件概率。若 $A(x)$ 未被完整定义，所谓“正确答案概率”也未被完整定义。

单一参考答案尤其容易把措辞多样性误作错误。反过来，允许宽松语义等价也可能把部分正确、含糊或相互矛盾的回答错误合并。语义事件需要可审计的映射，不能由 token 概率自动给出。

## 1.6 重复、冲突与来源权重

若记录 $i$ 在语料中复制 $m_i$ 次，而训练按记录均匀抽样，它对经验目标的权重近似放大 $m_i$ 倍。去重因此不只是节省存储，也改变经验分布。

相互冲突的文本会让不同续写都获得训练信号。模型不会仅凭出现频率知道哪一来源更可信；除非上下文、数据权重或训练目标提供可靠性线索，高频错误完全可能获得高似然，低频正确事实则可能落在尾部。

来源标签也不能自动解决问题。若“可靠来源”本身由启发式分类器定义，分类错误会继续进入训练权重。可靠性是数据管线的假设，需要独立验证。

## 1.7 时间是不可忽略的条件

对“某公司的 CEO 是谁”一类问题，目标依赖时间 $T$。若上下文没有日期，模型面对的是时间混合：

$$
P_D(Y\mid X=x)
=\sum_tP_D(Y\mid x,T=t)P_D(T=t\mid x).
$$

旧资料更多、近期资料更少时，混合分布可能偏向过时答案。该错误来源与 softmax temperature 无关；它来自条件缺失和数据时间权重。

时间变化还会造成部署漂移。即使模型在某个测试时间点校准，关系 $P(Y\mid X)$ 随时间改变后，原校准结论也不再自动成立。

## 1.8 标注者、协议与聚合

监督微调和偏好训练还经过任务规范。设标注者或群体为 $A$，指导协议为 $G$，则观测标签来自

$$
P_D(Y\mid X,A,G).
$$

将不同 $A,G$ 混合且不记录，会把规范分歧表现为标签噪声。多数投票估计的是指定群体和聚合规则下的多数选择，不会把价值判断变成客观真值。

至少应记录：

- 标注协议是否允许多选、部分正确或弃权；
- 标注者是独立作答还是能看到其他判断；
- 聚合规则怎样处理少数意见与平票；
- 哪些样本因争议或低质量被过滤；
- 训练时每个标签或偏好对获得何种权重。

标注者一致率也不是标签正确率。标注者可以一致地遵循错误规范，也可以因任务本来多解而低一致。

## 1.9 经验分布与重加权经验分布

给定记录 $(x_i,y_i)_{i=1}^n$，未加权经验分布为

$$
\widehat P_n
=\frac1n\sum_{i=1}^n\delta_{(x_i,y_i)},
$$

其中 $\delta_{(x_i,y_i)}$ 是在该样本上的点质量。对任意事件 $B$，

$$
\widehat P_n(B)
=\frac1n\sum_{i=1}^n\mathbf 1\{(x_i,y_i)\in B\}.
$$

实际训练常使用非负权重 $w_i$，并要求 $\sum_iw_i>0$：

$$
\widehat P_w
=\frac{1}{\sum_iw_i}\sum_iw_i\delta_{(x_i,y_i)}.
$$

$w_i$ 可以编码来源混合、质量分数、重复次数、长度规则和课程调度。若权重随训练步变化，则严格说训练面对的是一列时变分布，而不是单个固定 $P_{\mathrm{train}}$。

若先选择来源 $S=s$，再从该来源抽样，理想化训练分布可写为

$$
P_{\mathrm{train}}=\sum_s\lambda_sP_s,
\qquad \lambda_s\ge0,
\quad \sum_s\lambda_s=1.
$$

磁盘字节占比、文档占比、序列占比和 token 占比通常不同。报告数据规模时必须说明使用哪一种单位。

## 1.10 依赖样本不是额外独立证据

经验分布总能按上式定义，但其统计精度依赖采样结构。一本书切成一千个相邻窗口，不等于一千个独立来源；同一模板生成的一批回答也共享上游随机变量。

若将高度相关的窗口都当作 iid，频率点估计可能仍是目标样本集的描述，却会低估总体推断的不确定性。评测和数据审计应保留文档、站点、作者、模板或会话等聚类标识，后续按实际独立单位重采样。

去重只能减少某些可检测复制，不能把剩余记录自动变成独立样本。

## 1.11 分词和 packing 改变训练权重

语言模型通常按 token 计算损失。相同语义在不同语言或 tokenizer 下可能需要不同 token 数；长文档贡献更多预测位置。对样本 $i$，令目标 token 数为 $m_i$，则总损失可写为

$$
\ell_i(\theta)
=-\sum_{t=1}^{m_i}a_{it}
\log q_\theta(y_{it}\mid x_i,y_{i,<t}),
$$

其中 $a_{it}$ 是 loss mask 或位置权重。按有效 token 平均与先按样本平均再汇总是不同目标。

packing 还决定文档边界是否可见、跨文档 token 是否被屏蔽，以及短文档在 batch 中出现的方式。分词与 packing 不是纯存储细节，它们参与定义优化器实际看到的经验风险。

## 1.12 从本章能够识别什么

在清楚记录采样设计后，我们可以描述：

- 哪些来源和时间段进入了数据；
- 哪些记录因过滤、去重和权重被放大或压低；
- 在观测支持内，哪些条件与结果组合更常见；
- 标注与语义事件由何种协议构造。

仅由这些记录仍不能唯一识别：

- 未被观测的世界总体；
- 隐上下文的真实分解；
- 支持外输入的正确条件分布；
- 高频文本是否为真；
- 语义相同的所有字符串集合。

## 1.13 本章结论

模型概率的第一来源，是可见输入把许多完整情境压缩为同一条件；第二来源，是记录、选择、时间、标注、分词和训练采样重新分配了这些情境的权重。观测分布可以被严格描述，却不能独自识别其潜在生成机制。下一章将说明，交叉熵怎样把这个重加权经验分布投影到有限参数模型，并区分总体最优、经验最优和实际优化结果。
