# 跨卷符号约定

Chapter from the Chinese-language book Anatomy of the Stochastic Parrot: 跨卷符号约定.

## Metadata

- HTML: https://glenzli.com/en/dr-stochastic-parrot/stochastic-parrot-anatomy/notation/
- Markdown: https://glenzli.com/en/dr-stochastic-parrot/stochastic-parrot-anatomy/notation.md
- Collection: Dr. Stochastic Parrot
- Language: en
- Published: 2026-07-17
- Status: published
- Tags: ai-generated, stochastic-parrot, stochastic-parrot-anatomy, ai

## Content

局部变量在使用处定义。本表只约束跨卷重复出现的符号，避免把模型、训练分布、解码后分布和外部世界写成同一个对象。

## 模型与序列

| 符号 | 含义 |
|---|---|
| $V$ | 固定 tokenizer 的有限 token 词表 |
| $x_{1:n}$ | token 序列；$x_{<t}=x_{1:t-1}$ |
| $c$ | 除当前生成前缀外的条件，例如系统消息、用户输入或多模态编码 |
| $\theta$ | 一个固定模型 checkpoint 的参数 |
| $p_\theta(\cdot\mid c)$ | 固定参数模型的条件分布；卷三在与数据分布对照时记作 $q_\theta$ |
| $K_{\theta,\delta}(\cdot\mid c)$ | 固定基础模型经声明的解码协议 $\delta$ 后诱导的解码输出分布；不默认包含路由、过滤或工具执行 |
| $P_{\mathrm{sys}}(\cdot\mid r)$ | 给定版本化请求 $r$ 时，包含路由、过滤、工具与失败处理的系统可观察结果分布 |
| $Y$ | 一次运行产生的随机输出；其值域必须说明是 token、文本、媒体、调用候选还是外部结果 |
| $z\in\mathbb R^{|V|}$ | 词表上的 logits |
| $T>0$ | softmax temperature；greedy 另行定义，不把 $T=0$ 直接代入 softmax |
| $h_{\ell,p}$ 或 $x_{\ell,p}$ | 层 $\ell$、位置 $p$ 的 hidden/residual state |
| $W_U\in\mathbb R^{|V|\times d}$ | 采用列向量约定的 unembedding 矩阵：$z=W_Uh+b_U$；batch 实现若把 hidden state 放在最后一轴，则等价地右乘 $W_U^\top$ |

$p_\theta$ 与 $q_\theta$ 不是两类模型。前者是卷一、卷二常用的生成模型记号；卷三用 $q_\theta$，是为了把模型近似与数据侧的 $P_D$、$P_{\mathrm{train}}$ 明确分开。局部章节若使用 VAE 等领域惯例，会在使用处重新声明 $p_\theta$ 与 $q_\phi$。

## 数据、训练与概率

| 符号 | 含义 |
|---|---|
| $P_\star$ | 只在明确建模时使用的目标或世界侧分布；不假定研究者可直接观测 |
| $P_D$ | 经采集与处理形成的数据分布 |
| $P_{\mathrm{train}}$ | 来源混合和抽样权重实际定义的训练分布 |
| $\widehat P_n$ | $n$ 个观测定义的经验分布 |
| $\Omega$ | 数据顺序、初始化、数值内核等训练随机状态 |
| $\Theta=A(S,\Omega)$ | 训练算法 $A$ 在样本 $S$ 与随机状态 $\Omega$ 下输出的参数随机变量 |
| $H(p)$ | 离散 Shannon 熵，默认使用自然对数 |
| $H(p,q)$ | 交叉熵 $-\sum p\log q$ |
| $D_{\mathrm{KL}}(p\Vert q)$ | KL divergence；非对称，不是距离 |
| $\mathbb E[X]$、$\operatorname{Var}(X)$ | 期望与方差 |
| $\mathbf 1\{A\}$ | 事件 $A$ 的指示量 |
| $g:Y\to\mathcal E$ | 把原始输出映射为可分析事件或语义类别的版本化编码规则 |
| $\operatorname{do}(X=x)$ | 因果模型中的干预；不同于观察条件 $X=x$ |

写“某类回答的概率”时，必须给出事件集合或编码规则 $g$。自由文本的语义等价不是 token 空间自带的结构；更换 rubric、解析器或评审模型会改变被估计事件。

## 执行与系统

| 符号或术语 | 含义 |
|---|---|
| prefill | 对完整输入并行前向并建立 KV cache |
| decode step | 用当前缓存计算并选择下一 token 的一步 |
| $\delta$ | 已声明的解码协议，包括温度、截断、约束和停止规则 |
| $s_t$ | 第 $t$ 个执行边界上的版本化状态；具体字段由卷二声明 |
| $R$ | 运行记录或 trace 数据结构；局部使用时须另行说明 |
| trace | 按时间排列的模型计算、运行时处理和外部事件 |
| commit boundary | 外部副作用越过后不能靠取消当前请求自动撤回的边界 |

## 可解释性

| 符号或术语 | 含义 |
|---|---|
| $S(x)$ | 被解释的标量目标，例如 logit difference |
| $\mathcal D_{\mathrm{eval}}$ | 解释或干预结论所针对的输入分布；不是默认的“所有输入” |
| $a_u(x,p)$ | 单位 $u$ 在输入 $x$、位置 $p$ 的 activation |
| $\nabla_xS$ | 目标对输入的局部梯度 |
| $I$ | 明确声明的内部或输入干预算子 |
| $v$ | probe、steering 或 feature direction；构造方式必须另述 |
| $f$、$\hat x$ | 稀疏 feature activations 与重构 activation |
| $C$ | 相对于行为和输入分布定义的 circuit |

## 等式与比较

- `$=$` 表示所声明类型中的相等；文本相同、语义等价和任务成功不是默认同一关系。
- `≈` 只在局部已声明度量与容差时使用。
- 单次输出、条件分布和重复实验频率分别写作不同对象，不用一个“概率”互相替代。
- 条件竖线右侧只列模型实际条件或统计分析明确条件；未观测的现实因素不能悄悄并入 $c$。
- 经验平均、模型期望和训练随机性期望必须注明分别对哪个随机变量取平均。
- 局部章节可复用字母，但必须在首次出现处重新定义。
