# Proofs and Technical Appendices

Chapter from the Chinese-language book Anatomy of the Stochastic Parrot: 数学与模型推导.

## Metadata

- HTML: https://glenzli.com/en/dr-stochastic-parrot/stochastic-parrot-anatomy/appendices/
- Markdown: https://glenzli.com/en/dr-stochastic-parrot/stochastic-parrot-anatomy/appendices.md
- Collection: Dr. Stochastic Parrot
- Language: en
- Published: 2026-07-17
- Status: published
- Tags: ai-generated, stochastic-parrot, stochastic-parrot-anatomy, ai

## Content

本目录只收录卷一正文若就地展开会打断主线、但研究生读者应能核验的定义与推导。它不是第二套平行教材，也不承担卷二的执行追踪、卷三的概率解释或卷四的可解释性研究。

[进入学习与模型数学讲义](/en/dr-stochastic-parrot/stochastic-parrot-anatomy/appendices/learning-notes/)

## 使用方式

读者不需要按 A.1--A.12 线性通读。遇到正文链接时进入相应条目即可：

| 路径 | 建议顺序 | 服务的正文问题 |
| --- | --- | --- |
| 学习与泛化 | A.1 -> A.3 -> A.4 -> A.8 | 梯度更新何时成立，容量界、正则化和 AdamW 的边界是什么 |
| 早期神经网络 | A.2 -> A.5 -> A.7 | 感知机为何收敛，多层网络能表示什么，分类输出怎样训练 |
| 反向传播与算子 | A.6 -> A.9；A.6 + A.7 -> A.10 | batch 形状、卷积伴随与 attention 反向怎样核对 |
| 后训练 | A.7 -> A.11 | token log probability、策略梯度、PPO 和 DPO 怎样连接 |
| 多模态表征 | A.7 -> A.12 | 对比损失、表示梯度和互信息下界何时成立 |

## 先修范围

核心推导默认读者掌握线性代数、多元微积分和初等概率。A.3、A.11 与 A.12 还使用条件期望、KL 散度和独立采样；可先读卷三的[最小概率工具箱](/en/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/APPENDIX-PROBABILITY/)。A.5 的一般通用逼近证明使用 Hahn--Banach 与 Riesz--Markov 定理；不具备泛函分析先修时，可以接受所列引理并完整阅读一维 ReLU 构造。

## 编号与边界

`A.1`--`A.12` 是本目录内部编号。卷三概率工具箱也使用局部小节编号 `A.1` 等，引用时应同时写明文件或主题，不能把两套编号拼成一个全书连续定理序列。

每篇附录末尾给出其直接依赖的原始来源。正文中的历史、模型谱系与更新较快的工程事实仍以各卷来源表为准；附录来源只支撑所陈述的数学结果和算法定义。
