# 第八章 概率分析的识别边界

《随机鹦鹉解剖学》章节：第八章 概率分析的识别边界。

## Metadata

- HTML: https://glenzli.com/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/ch08-limits-probability-language/
- Markdown: https://glenzli.com/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/ch08-limits-probability-language.md
- Collection: Dr. Stochastic Parrot
- Language: zh-CN
- Published: 2026-07-17
- Status: published
- Tags: ai-generated, stochastic-parrot, stochastic-parrot-anatomy, ai

## Content

概率可以严密描述模型、数据与重复实验，但严格公式不会自动提供真值、隐机制、因果或分布外保证。本章不再增加指标，而是说明前七章的结论在哪些边界停止。

## 8.1 三个不应互换的对象

给定提示 $x$ 和回答文本 $y$，至少有三个对象：

1. 模型序列质量 $q_\theta(y\mid x)$；
2. 任务事件概率 $P(g(Y)=1\mid X=x)$；
3. 关于世界的命题 $\varphi(y)$ 是否为真。

第一项由模型和 tokenization 定义；第二项还需要输出生成过程、语义映射与任务总体；第三项需要事实来源、测量、数据库、证明或可靠工具。

它们可以相关，但不存在一般恒等式

$$
q_\theta(y\mid x)
=P(g(Y)=1\mid X=x)
=\mathbf 1\{\varphi(y)\text{ 为真}\}.
$$

把其中任一数值直接替换另一个，是概率分析中最常见的类别错误。

## 8.2 高模型概率不等于真实

若训练数据高频重复错误，模型可以给错误续写很高概率；若正确事实罕见、较新或在当前提示下措辞异常，正确序列也可能低概率。

模型概率回答“这个模型在这些条件下如何分配文本质量”。只有当模型被专门训练来预测一个明确世界事件，并在相关总体上用真实标签校准后，其输出才能作为该事件概率的经验估计。即使如此，结论仍受标签和分布漂移限制。

低模型概率也不等于现实不可能。top-k、grammar mask 和过滤器能把基础模型正概率事件变成系统零概率；反过来，模型给某种灾难文本非零概率，也不表示现实灾难具有同一概率。

## 8.3 可识别性的定义

设可观测数据分布由潜在机制 $m$ 诱导为 $P_m^{obs}$，关心的量为 $\psi(m)$。若

$$
P_{m_1}^{obs}=P_{m_2}^{obs}
\quad\Longrightarrow\quad
\psi(m_1)=\psi(m_2),
$$

则称 $\psi$ 可由观测分布识别。若存在两个观测等价机制却给不同 $\psi$，无限观测数据也不能仅凭该分布区分它们。

本卷已经遇到多种不可识别：

- 同一输出边缘分布可来自不可约随机或隐藏确定状态；
- 纯黑盒系统频率不能分离基础模型与过滤器；
- 单一训练 checkpoint 不能区分配方平均效应与 seed 偶然性；
- token 序列分布不能自行确定语义等价映射；
- 观察相关分布不能唯一确定现实因果方向。

增加公式不会修复这些问题。需要新的观测、干预、重复层级或可辩护结构假设。

## 8.4 训练支持之外不存在免费识别

设训练输入支持为 $S$，部署会遇到 $x^*\notin S$。构造两个目标机制 $Q_0,Q_1$：它们在 $S$ 上完全相同，但在 $x^*$ 上分别满足

$$
Q_0(Y=1\mid x^*)=0,
\qquad
Q_1(Y=1\mid x^*)=1.
$$

任何只观察 $S$ 上数据的学习算法，在两个机制下看到的训练分布相同，因而诱导相同的预测分布；该预测不可能同时在 $Q_0,Q_1$ 下都正确。这给出支持外无保证的最小反例。

模型归纳偏置、预训练迁移和领域知识可以使外推在实践中成功，但成功依赖额外结构。它不是由当前训练分布本身识别的结论。

“OOD 检测器分数很高”也不消除此边界。低似然、embedding 距离和 ensemble 分歧都可能对某些转移有效、对另一些失败；检测器本身仍需目标漂移数据验证。

## 8.5 三类常见分布漂移

令训练或校准分布为 $P$，部署分布为 $Q$。

### Covariate shift

$$
P_X\ne Q_X,
\qquad
P(Y\mid X)=Q(Y\mid X).
$$

输入构成改变，但给定输入后的标签机制保持。若目标支持被源支持覆盖，可尝试输入密度比加权。

### Label shift

$$
P_Y\ne Q_Y,
\qquad
P(X\mid Y)=Q(X\mid Y).
$$

类别基率变化而类条件输入分布保持。该假设在开放生成中通常很强，需要明确有限事件标签才可使用。

### Conditional 或 concept shift

$$
P(Y\mid X)\ne Q(Y\mid X).
$$

事实随时间变化、政策规范改变、用户目标变化或上游工具语义变化都可能属于此类。仅重加权旧输入不能恢复新的条件关系，通常需要新标签或结构模型。

现实漂移可以同时包含三类。给变化命名不等于已验证相应不变性假设。

## 8.6 校准为何不能无条件迁移

模型在 $P$ 下二元校准意味着

$$
P(Y=1\mid S=s)=s.
$$

部署后需要的是

$$
Q(Y=1\mid S=s)=s.
$$

前式不推出后式。即使只有 covariate shift，若同一分数 $s$ 聚合了多个具有不同真实风险的输入，$Q$ 改变这些输入在分数组内的比例后，校准也会改变。

一个足够强但现实中难满足的条件是：分数本身等于稳定的真实条件概率，

$$
S(X)=P(Y=1\mid X)=Q(Y=1\mid X).
$$

此时由条件期望塔式可得 $Q(Y=1\mid S)=S$。普通测试集校准远弱于这个条件。

因此“模型已经校准”必须附带分布、时间、事件和校准方法；部署监测还需新标签，因为只看置信分布变化不能判断准确率是否保持。

## 8.7 确定性解码不等于确定知识

greedy 只选择当前最高分 token。它消除显式采样，却不消除数据偏差、模型误差、未观测条件和服务更新。系统可以每次稳定返回同一幻觉。

反过来，采样输出变化也不证明模型“什么都不知道”。对允许多种正确表达的任务，合理分布本应在多个字符串上有质量。

正确的分析对象是定义后的事件风险，例如“不同采样中事实命题是否一致且正确”，而不是把文本是否逐字相同当作知识指标。

## 8.8 语义事件不是模型内生类别

模型直接分配 token 序列概率。把多个字符串合为“同一个答案”需要映射

$$
g:\mathcal S\to\mathcal C.
$$

不同 $g$ 可以对含糊、部分正确、复合主张和拒答作不同处理，并诱导不同事件概率。除非任务本身给出规范语义空间，否则没有唯一的“真正聚类”。

semantic entropy 和采样一致性可以在固定 $g$ 下严密计算；它们不能证明 $g$ 已捕获全部意义。由另一个模型实现 $g$ 时，两个模型共享训练数据或推理偏差还会产生相关误判。

所以开放回答概率结论必须同时审计生成器与事件测量器。

## 8.9 自报置信是新的语言行为

让模型回答“我有 90% 把握”产生的是另一段 token。该数字可能来自训练中的常见置信措辞、提示锚定、角色规范或显式计算。

只有定义外部正确性标签 $Z$，并验证

$$
P(Z=1\mid S=0.9)\approx0.9,
$$

自报数值才在该任务总体上具有校准含义。换一种提问格式、语言、推理预算或工具权限后，应重新检验。

口头犹豫也不等于 raw softmax 熵高：模型可以高概率生成“我不确定”，也可以沿低概率路径产生武断措辞。

## 8.10 条件相关不等于现实因果

观察条件分布

$$
P(Y\mid X=x)
$$

描述看到 $X=x$ 的样本中 $Y$ 怎样变化；干预分布

$$
P(Y\mid do(X=x))
$$

描述主动设置 $X$ 后的结果。存在共同原因、选择偏差或反向因果时，二者可不同。

大模型从文本共现学习强条件关联，不因此自动识别药物、政策或社会行动的干预效应。用模型补全“服药后……”不能替代随机试验、因果图假设与领域测量。

提示干预可以识别“改变这段输入对这个计算系统输出的影响”，但不能直接升格为同名现实变量的因果效应。

## 8.11 模型内部干预也需限制结论

将某层 activation 置零并观察 logit 改变，是对模型计算图的干预。它可以支持：在给定替换基线、输入和模型下，该内部变量对输出有因果影响。

它不自动证明：

- 该变量唯一表示某个人类概念；
- 训练数据中的概念导致了该变量形成；
- 真实世界同名因素具有相同因果作用；
- 其他替代干预会得到相同效应。

卷四将区分相关探针、activation patching 与机制证据。卷三只要求不把输出概率关联误写为现实因果。

## 8.12 反馈回路使部署分布内生变化

部署系统可能影响后续数据：推荐改变用户点击，生成文本进入未来语料，拒答使用户改写请求，模型评分决定哪些样本被人工标注。于是第 $t$ 时刻数据分布可依赖过去行动：

$$
P_{t+1}(X,Y)
=F(P_t,A_t,E_t).
$$

此时请求不再是来自固定总体的 iid 样本，离线测试风险也不等于长期策略风险。只监测平均准确率可能遗漏选择性暴露和累积偏差。

分析需要记录策略版本、暴露机制与时间，必要时使用在线实验、序列因果或适应性数据方法。把动态系统硬塞进静态二项区间会给出虚假的精度。

## 8.13 平均指标隐藏条件失效

总体风险是条件风险的加权平均：

$$
R=\sum_gP(G=g)R_g.
$$

小群体权重低时，较大 $R_g$ 可能被总体均值掩盖。总体校准也可能由不同子群的过置信与欠置信抵消。

但无限细分子群又会导致样本不足和选择偏差。合理做法是依据部署风险预先指定关键分层，报告样本量和区间，并把探索发现放到新数据确认。

最坏群体风险只有在群体集合事先定义且覆盖部署关注对象时才有意义；它不自动保护未定义或未来出现的群体。

## 8.14 低平均风险不等于可部署

“系统失败概率为 1%”不能单独决定是否部署。至少还需要：

- 失败后果及其分布，而非只计次数；
- 暴露次数与相关性；
- 受影响主体和风险集中程度；
- 可逆性、检测能力和恢复时间；
- 人工监督、权限与回退机制。

若单次损失为 $L(a,Y)$，决策关注的是期望或其他风险函数

$$
\mathbb E[L(a,Y)],
$$

而不仅是 $P(\text{failure})$。尾部损失、约束和法规还可能使期望损失不足以描述决策。

输出经过随机采样，不意味着开发者、部署者或使用者免除责任；输出确定也不自动把责任归给单一主体。责任是制度与控制问题，不由概率机制推导。

## 8.15 一张概率结论检查表

看到一个“模型概率”时，依次询问：

1. 随机变量、事件与输出映射是什么？
2. 条件中实际包含哪些 token、工具和系统状态？
3. 数值来自数据频率、基础 softmax、解码后采样还是外部预测器？
4. 总体、独立抽样单位和时间窗口是什么？
5. tokenizer、候选集、长度和停止如何影响数值？
6. 语义或正确性标签由谁定义，误差多大？
7. 校准和区间依赖哪些分布与独立性条件？
8. 是否存在支持缺口、漂移或反馈回路？
9. 结论是预测、事实、因果还是决策？
10. 哪些相反机制与现有观测仍然等价？

最后一问尤其重要：若相反解释产生同样观测，就应明确写出不可识别，而不是用更复杂术语填补证据缺口。

## 8.16 卷末结论

模型中的概率有一条完整但分层的来源链：世界和语言允许多种实现；可见输入边缘化隐上下文；记录、筛选、标注和分词形成训练分布；对数损失把它投影到受限模型族；随机训练产生 checkpoint 分布；logits 经 softmax 表示 token 条件分布；解码、工具和过滤诱导系统输出；实验再以有限、可能相关的样本估计行为与风险。

这条链能严密回答“哪个分布”“在什么条件下”“怎样估计”和“误差来自哪里”。它不能单独回答隐机制是否唯一、命题是否真实、现实干预会怎样或系统是否应被授权行动。到此，卷三已经完成自身职责：概率是模型分析语言，不是真值、因果与责任的替代物。

下一卷转向模型内部机制：哪些 activation、feature、head 与 circuit 参与形成这些 logits，相关观察如何升级为可重复干预。那里，概率输出是被解释对象之一，而不是解释本身。
