# 第七章 模型概率的实验分析

《随机鹦鹉解剖学》章节：第七章 模型概率的实验分析。

## Metadata

- HTML: https://glenzli.com/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/ch07-model-probability-analysis/
- Markdown: https://glenzli.com/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/ch07-model-probability-analysis.md
- Collection: Dr. Stochastic Parrot
- Language: zh-CN
- Published: 2026-07-17
- Status: published
- Tags: ai-generated, stochastic-parrot, stochastic-parrot-anatomy, ai

## Content

概率分析的目标不是生成尽可能多的图表，而是估计一个明确对象，并说明有限样本、模型运行和测量过程带来多少误差。本章给出适用于 logits、黑盒采样、训练运行和完整服务的实验程序。

## 7.1 从 estimand 开始

estimand 是实验希望知道的总体量。例如：

$$
\mu_A
=P_{X\sim P_X,\,Y\sim K_{\theta,\delta}}
\{g(X,Y)=1\},
$$

表示在输入总体 $P_X$、模型 $\theta$、解码协议 $\delta$ 与事件判定 $g$ 下，输出满足事件的概率。

这里的 $Y$ 是解码输出。若研究对象是带路由、过滤、工具和失败处理的完整服务，应把条件分布改写为 $P_{\mathrm{sys}}(\cdot\mid r)$，并把版本化请求 $r$ 纳入 estimand；不能继续用 $K_{\theta,\delta}$ 指代不可分离的整套系统。

一个完整问题至少要固定：

- 输入总体或采样框 $P_X$；
- 模型、checkpoint、tokenizer 与模板；
- 基础 logits、处理后解码器还是完整系统；
- 输出到事件或分数的映射 $g$；
- 哪些随机因素纳入平均，哪些固定；
- 指标、目标精度和比较方向。

“比较两个模型谁更自信”不是 estimand。可改为：“在固定多选总体与统一模板下，比较正确选项条件化概率的平均 NLL，并在输入单位上给出配对区间。”

## 7.2 分析权限决定可识别对象

三种访问层能回答不同问题。

### 白盒或 logit 访问

可以直接读取原始 logits、完整词表概率和中间处理结果，适合分析赔率、候选外质量与解码变换。

### 受限 logprob API

可能只返回所选 token 或 top-$k$ 候选。未返回质量无法由局部列表恢复；还必须确认 logprob 位于温度和截断的哪一侧。

### 纯黑盒文本访问

只能通过重复采样估计系统输出事件概率。即使样本无限，也只能识别完整系统分布，无法单独分离基础 logits、过滤器和工具状态，除非额外干预系统组件。

访问限制不是统计技巧可以绕过的信息缺失。报告必须把结论限制在实际可观测层。

## 7.3 实验单位与抽样单位

自然语言实验常同时包含多个层级：

- 用户、文档或问题；
- 同一问题的提示变体；
- 训练 checkpoint；
- 同一 checkpoint 的解码运行；
- 人工或模型评审者。

“样本量”必须指明层级。一百个问题各运行十次产生一千条文本，但对输入总体的独立单位通常仍是一百个问题；若问题来自十篇共享文档，独立来源可能更少。

区间和 bootstrap 应在 estimand 的推广层级重采样。把所有生成文本当作 iid，通常会低估共享问题、checkpoint 和评审者造成的相关性。

## 7.4 Logit 侧的配对分析

对同一前缀下固定候选 $a,b$，使用

$$
\Delta_{a,b}(x)=z_a(x)-z_b(x)
=\log\frac{q(a\mid x)}{q(b\mid x)}.
$$

它不受其余词表归一化项和 logit 常数平移影响。若候选由多个 token 组成，应比较完整序列 log likelihood，而不是只比较首 token。

研究输入变换 $v$ 时，为同一内容构造配对输入 $x_i^{(0)},x_i^{(1)}$，并计算

$$
d_i
=\Delta(x_i^{(1)})-\Delta(x_i^{(0)}).
$$

配对设计消除了同一输入的部分难度变异。因果解释仍只针对所实施的变换；若变换同时改变语义、长度与格式，$d_i$ 不能分解这些因素。

除了均值，应检查 $d_i$ 分布、符号比例和极端样本。少数巨大 logit 差可能主导平均值。

## 7.5 候选集实验的规范

固定选项实验应记录：

- 标签 token 是否均为单 token；
- 选项顺序与标签映射是否随机化；
- 前导空格、大小写、标点与 EOS；
- 比较标签还是完整答案文本；
- 候选外质量如何处理；
- 多 token 候选使用总 logprob 还是预注册的长度分数。

候选内归一化

$$
\widetilde q(a_k)
=\frac{q(a_k)}{\sum_jq(a_j)}
$$

得到条件于候选集的分布。应同时报告分母

$$
m_A=\sum_jq(a_j),
$$

因为 $m_A$ 很小时，候选内概率可以看似极端，而模型绝大多数质量实际位于其他文本。

选项顺序随机化应在输入单位上配对分析。若每个排列都当作独立问题，会把同一题的重复伪装成更多独立证据。

## 7.6 Monte Carlo 估计行为概率

固定模型、解码协议与输入 $x$，令 $Y_1,\ldots,Y_n$ 独立来自 $K_{\theta,\delta}(\cdot\mid x)$。对事件 $A$，

$$
\widehat p
=\frac1n\sum_{r=1}^n
\mathbf 1\{Y_r\in A\}
$$

是 $p=P(Y\in A\mid x)$ 的无偏估计，且

$$
\operatorname{Var}(\widehat p)
=\frac{p(1-p)}{n}.
$$

标准误差按 $n^{-1/2}$ 缩小。将误差减半通常需要约四倍独立运行。

小样本或 $\widehat p$ 接近 0、1 时，不应只报告正态近似区间。Wilson 区间公式见[概率附录 A.8](/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/APPENDIX-PROBABILITY/)。若 $n$ 次运行零失败，失败概率并未被证明为零；置信水平 $1-\alpha$ 的精确单侧上界为

$$
1-\alpha^{1/n},
$$

在 $\alpha=0.05$ 且 $n$ 较大时约为 $3/n$。

对纯黑盒完整服务，同一估计式仍可使用，但此时抽样声明应写成 $Y_r\sim P_{\mathrm{sys}}(\cdot\mid r)$。所谓“独立重复”还要求请求之间不共享会改变分布的会话记忆、缓存写入、速率状态或外部工具状态；否则应显式建模相关性，而不是沿用下面的 iid 方差公式。

## 7.7 一般分数的均值与区间

对有界或有限方差分数 $S_r=s(Y_r)$，目标为

$$
\mu=\mathbb E[S],
\qquad
\widehat\mu=\frac1n\sum_rS_r.
$$

iid 条件下估计标准误差为

$$
\widehat{SE}(\widehat\mu)
=\frac{\widehat\sigma}{\sqrt n}.
$$

大样本正态区间依赖中心极限定理近似；重尾、强离散或样本很少时，可使用预先选择的稳健统计量、适当 bootstrap 或精确方法。无论采用何法，区间覆盖率都依赖抽样假设。

只给均值而不报告离散程度，会把高方差系统和稳定系统混为一谈。只给标准差也不等于均值估计的标准误差：前者描述个体结果，后者描述均值精度。

## 7.8 相关采样怎样改变标准误差

若 $S_1,\ldots,S_n$ 不独立，

$$
\operatorname{Var}(\widehat\mu)
=\frac1{n^2}
\sum_{r=1}^n\sum_{s=1}^n
\operatorname{Cov}(S_r,S_s).
$$

正相关使方差大于 iid 公式，负相关则可能减小。若序列二阶平稳、方差为 $\sigma^2$、滞后 $k$ 自相关为 $\rho_k$，则

$$
\operatorname{Var}(\widehat\mu)
=\frac{\sigma^2}{n}
\left[
1+2\sum_{k=1}^{n-1}
\left(1-\frac{k}{n}\right)\rho_k
\right].
$$

若 $\sum_{k\ge1}|\rho_k|<\infty$，大样本时可定义
$\tau_{\mathrm{int}}=1+2\sum_{k\ge1}\rho_k$；当 $\tau_{\mathrm{int}}>0$ 时，渐近有效样本量为

$$
n_{\mathrm{eff}}
=\frac{n}{\tau_{\mathrm{int}}}.
$$

该公式只适合可辩护的平稳相关结构，不应机械套用于任意 API 请求。会话记忆、共享检索、滚动更新与同一上游生成都可能产生非平稳或聚类依赖。

实务上优先保留聚类标识，并按会话、文档或用户做 cluster bootstrap；若请求按时间相关，则采用区块重采样或显式时间模型。

## 7.9 比较系统时利用配对

同一输入 $i$ 同时评测系统 A、B，定义

$$
D_i=S_{i,A}-S_{i,B},
\qquad
\widehat\delta=\frac1n\sum_iD_i.
$$

其方差包含

$$
\operatorname{Var}(D_i)
=\operatorname{Var}(S_{i,A})
+\operatorname{Var}(S_{i,B})
-2\operatorname{Cov}(S_{i,A},S_{i,B}).
$$

同一输入通常使两系统分数正相关，从而降低差值方差。分别对两组均值做无配对比较会丢失这一信息。

paired bootstrap 的基本步骤是：

1. 以输入为单位有放回抽取索引 $i_1^*,\ldots,i_n^*$；
2. 对每个索引同时取 A、B 的结果；
3. 计算 bootstrap 差值 $\widehat\delta^*$；
4. 重复并用预先规定的方法构造区间。

若每个输入内又有多次生成，需保持层级：先重采样输入，再在输入内按实际独立单位处理运行。不能把 A、B 各自独立 bootstrap 后再相减。

## 7.10 共用随机数既可能降方差也可能失效

模拟实验有时让 A、B 使用同一随机数流，称为 common random numbers。若相同随机数使两个结果正相关，配对差方差可下降。

自回归生成中，一旦两系统在某步选择不同 token，后续条件分布和随机数消费顺序可能分叉；“相同 seed”不再保证可解释的一一对应。动态 batching 也可能改变消费顺序。

因此应把**输入配对**与**随机流配对**分开报告。前者通常稳定可定义；后者只有在采样实现和耦合方式完全记录时才具有统计含义。

## 7.11 多 checkpoint 与层级 bootstrap

若研究训练算法而非单个工件，数据含 checkpoint $j$、输入 $i$ 和解码运行 $r$。一种非参数流程是：

1. 在训练配方内重采样 checkpoint；
2. 重采样输入或更高层文档；
3. 必要时在每个 checkpoint 与输入组成的单元内重采样解码运行；
4. 对每个 bootstrap 样本重新计算完整指标。

这估计的变异同时包含所重采样层级。若只有一个 checkpoint，就不能由 bootstrap 虚构训练运行方差；若只有一个评审者，也不能推广到评审者总体。

模型数很少时，区间对方法选择会敏感。应展示每个 checkpoint 的结果，并将结论限制为探索性或个案性，而不是用复杂模型掩盖缺少重复。

## 7.12 语义事件的测量误差

令真实语义事件为 $A\in\{0,1\}$，自动判定器输出 $G\in\{0,1\}$。设灵敏度

$$
a=P(G=1\mid A=1)
$$

和假阳性率

$$
b=P(G=1\mid A=0).
$$

若二者在目标总体上稳定，则观察到的阳性率满足

$$
p_G=P(G=1)=ap+b(1-p)=b+(a-b)p,
$$

其中 $p=P(A=1)$。当 $a\ne b$ 时，

$$
p=\frac{p_G-b}{a-b}.
$$

这说明评审误差不会因样本量增大自动消失；若直接把 $G$ 当真标签，估计会趋向 $p_G$ 而不是 $p$。当 $a$ 接近 $b$ 时，校正问题近乎不可识别，$a,b,p_G$ 的小估计误差会被分母放大。有限样本的代入估计还可能落在 $[0,1]$ 之外；直接截断虽能得到表面合法的概率，却不能修复识别弱或区间估计错误。

实际判定误差常依模型、语言和答案难度变化，上式的常数假设可能不成立。

应从各系统、子群和置信区域分层抽样人工复核，报告 uncertain 类别，并对 $a,b$ 的估计误差做敏感性分析。用同一家族模型生成又评判可能产生相关错误，不能仅凭高一致率排除。

## 7.13 校准实验的正确数据分割

一个可审计流程是：

1. 预先定义事件、标签与置信分数；
2. 用训练数据拟合生成器或预测器；
3. 用独立 calibration set 拟合 temperature、isotonic 映射或阈值；
4. 在未参与选择的 test set 上报告 NLL、Brier、reliability 和 ECE；
5. 给关键类别、时间和子群的结果及区间；
6. 部署分布变化后重新评估。

若比较多种校准器并用 calibration set 选优，这是合法的模型选择；最终性能仍需独立 test。若在 test 上继续选 bin、阈值和展示子群，test 已成为探索集，应再用确认数据。

开放回答必须先把输出映射到有限事件或定义独立 correctness score。对模型自报概率的校准，只能说明该自报分数在指定提示协议和总体下的频率性质，不能反推 raw softmax 已校准。

## 7.14 分布漂移下的目标风险

设源分布为 $P$，部署目标为 $Q$，希望估计

$$
\mu_Q=\mathbb E_Q[h(X,Y)].
$$

若 $Q$ 对 $P$ 绝对连续，密度比

$$
w(x,y)=\frac{dQ}{dP}(x,y)
$$

存在，则

$$
\mu_Q=\mathbb E_P[w(X,Y)h(X,Y)].
$$

这给出 importance weighting 的理论基础。但它要求：

- 目标支持不超出源支持；
- 密度比可识别或可合理估计；
- 权重尾部不过于极端，否则方差巨大；
- 标签机制变化被正确建模。

若只发生 covariate shift，即 $P(Y\mid X)=Q(Y\mid X)$，权重可简化为 $w(X)=dQ_X/dP_X$。若条件关系本身改变，仅重加权输入不能恢复目标风险。

剪裁极端权重能降方差，却引入偏差；自归一化权重也改变有限样本性质。报告应同时给权重分布、有效样本量和支持缺口，而不是只给修正后的均值。

## 7.15 训练因素实验

设训练配方为 $r$、训练 seed 为 $j$、输入为 $i$，分数为 $Y_{rij}$。可用

$$
Y_{rij}=\mu+\alpha_r+b_{rj}+u_i+\varepsilon_{rij}
$$

组织配方、运行和输入变异，也可用相同层级做 bootstrap。使用该模型时必须采用[第五章的识别约束与零均值随机效应假设](/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/ch05-training-randomness-model-variation/#510-一个分层行为模型)；否则 $\alpha_r$ 与 $b_{rj}$ 的分解本身不唯一。关键不在选择最复杂模型，而在设计是否允许区分因素。

每个配方只有一个 checkpoint 时，$\alpha_r$ 与 $b_{rj}$ 混杂；只增加测试输入不能解决。训练成本高时可以诚实报告“这两个工件的差异”，不能写成“该算法平均提高了多少”。

若 checkpoint 是按验证集最优结果选出，选择过程也属于算法。比较时应在每个运行中重复同一选择规则，而不是事后只挑有利工件。

## 7.16 首分歧定位系统差异

比较两条自回归轨迹，定义首次不同 token 位置

$$
\tau=\min\{t:Y_t^{(A)}\ne Y_t^{(B)}\}.
$$

在 $\tau$ 前一时刻依次比较：

1. 实际 input token IDs；
2. 原始 logits 或关键 logit difference；
3. penalty、mask、temperature 后 logits；
4. top-k/top-p 后支持与概率；
5. PRNG 状态和抽样均匀数；
6. 后过滤与显示映射。

若原始 logits 已不同，原因在输入、权重或数值前向；若只在截断后不同，原因在解码处理；若 token 相同而显示不同，原因在反分词或客户端。最终文本差异很大时，首次分歧 trace 往往比对终点做抽象解释更有定位价值。

## 7.17 多重比较、选择偏差与确认

若同时扫描大量提示、token、层、子群和指标，出现偶然极值的机会随之增加。探索阶段可以广泛搜索，确认性阶段应：

- 预注册主要 estimand 或使用独立确认集；
- 报告总测试数与选择过程；
- 根据问题控制 family-wise error 或 false discovery rate；
- 在新数据、模型或训练运行上复验；
- 保留负结果和不稳定结果。

只展示最醒目的 logit 峰值、最佳 prompt 或最高相关层，会把选择过程隐藏在图表之外。置信区间若未包含选择步骤，覆盖率也会失真。

统计显著不等于工程重要。应同时给效应量、区间、失败类型与实际损失差异。

## 7.18 最小可复核记录

建议保存：

- 数据版本、采样框、样本 ID、聚类 ID 与预处理；
- 模型、权重哈希、tokenizer、template 和服务版本；
- 原始请求与规范化后的实际 token 输入；
- 原始 logits 或 API 能提供的最早概率层；
- 全部解码参数、处理顺序与 stop 条件；
- seed、重复层级、请求时间与运行环境；
- 语义映射、评审协议、评审者和版本；
- 每个输入、checkpoint 和运行组合的原始结果；
- 排除、重试、失败与缺失数据的处理规则。

这些记录不是形式主义附录，而是判断某个概率数值属于哪一层、某个区间是否使用正确独立单位的必要证据。

## 7.19 一套端到端分析模板

以“系统在开放问答中产生事实正确答案的概率”为例：

1. 从目标用户问题总体按已记录设计抽样问题；
2. 固定模型、检索、解码、工具和版本窗口；
3. 每题重复采样，保存所有拒绝与超时；
4. 用预定义语义协议标注正确、错误、拒答和 uncertain；
5. 对判定器分层人工复核，估计测量误差；
6. 以问题为主要重采样单位，运行嵌套在问题内；
7. 报告总体和关键子群概率、区间与 risk-coverage；
8. 若比较系统，对同一问题配对并保持相同评审协议；
9. 若部署总体不同，检查支持与权重，而非默认测试结果迁移；
10. 将结论限定为该系统协议下的行为概率，不写成模型内部知识的直接测量。

这套模板不要求复杂统计模型，但要求每一步的随机变量、总体与选择机制可检查。

## 7.20 本章结论

有效分析始于 estimand、访问层和独立单位。iid Monte Carlo 给出简单估计与区间；相关请求、多 checkpoint 和评审误差则需要聚类、配对或分层处理。importance weighting 只有在支持与漂移假设成立时才连接测试与部署总体。复杂公式不能修复不可识别设计；原始逐样本记录和明确的系统边界通常更重要。
