# 第五章 事后解释学：人类如何给矩阵写传记

《随机鹦鹉解剖学》章节：第五章 事后解释学：人类如何给矩阵写传记。

## Metadata

- HTML: https://glenzli.com/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-05/ch05-posthoc-hermeneutics/
- Markdown: https://glenzli.com/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-05/ch05-posthoc-hermeneutics.md
- Collection: Dr. Stochastic Parrot
- Language: zh-CN
- Published: 2026-07-17
- Status: published
- Tags: ai-generated, stochastic-parrot, stochastic-parrot-anatomy, ai

## Content

我先给出行为，人类再寻找故事。某个 attention head 像在追踪名字，某个 feature 像在识别法律文本，某条回路像在完成比较。故事可能准确、局部准确，也可能只是研究者在高维对象里认出熟悉的词。

这不是嘲笑解释。没有选择、命名和压缩，数字不会自动变成人能够使用的知识。问题不在于解释经过制作，而在于制作出的故事要向什么证据负责。

## 5.1 本章命题：可理解与忠实必须分别证明

本章主张：**一个解释可以易懂、有启发、甚至给出好理由，却仍未忠实描述模型产生结果时实际使用的机制；反过来，一个局部忠实的机制描述也可能无法回答读者真正关心的问题。**

这不是相对主义。它要求先规定解释任务，再评价证据：

- **对象**：解释一次输出、一个行为规律、一个内部 feature，还是整个模型家族？
- **对比项**：解释为什么输出 A 而不是 B，为什么这个提示成功而另一个失败，还是为什么模型整体具备某能力？
- **受众与用途**：研究发现、调试、安全审计、用户申诉或教学需要的压缩不同；
- **证据承诺**：解释声称相关、可预测、可干预，还是给出完整机制？

Lipton 区分透明性、事后解释及可解释性的不同目的，说明“可解释”从一开始就不是单一性质，参见 [Lipton（2018）](/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-05/SOURCES/#lipton-2018)。Miller 对解释的社会科学综述进一步强调，人类解释往往是对比性的、选择性的和互动性的，参见 [Miller（2019）](/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-05/SOURCES/#miller-2019)。这种可用性标准不与机制忠实相同。[卷四](/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-04/)已经给出不同技术路线；本章负责审查它们被写进人类叙事时发生的转换。

## 5.2 先确定究竟在解释什么

“为什么模型这样回答”至少可能是在问：

1. 哪些输入变化会改变输出？
2. 哪些内部状态与输出相关？
3. 哪些内部路径在正常运行中对输出具有因果作用？
4. 训练数据与目标怎样形成这种倾向？
5. 当前系统为什么允许这个回答到达用户？
6. 为什么这个回答对人而言显得合理或冒犯？

六问的 explanandum 不同。输入归因不能单独回答训练史，内部回路不能解释产品为何没有拦截，用户访谈也不能证明某个神经元参与了生成。

解释失败常不是数据错误，而是答案换了问题。研究者展示 attention 图，读者以为看见完整推理；产品给出自然语言理由，用户以为得到因果轨迹；组织解释“模型不可预测”，受影响者实际追问的是为何部署和谁能补救。

严格解释的第一步不是选择方法，而是把“为什么”补全。

## 5.3 行为先于故事，也先选择了故事

一个模型先在测试或使用中表现出规律，研究者才决定解释什么。目标选择已经带着人类兴趣：我们寻找国家、情绪、欺骗、拒绝和推理，却很少为某个无法命名的向量方向写论文。

这种选择不可避免。科学从问题开始，问题总与人的概念和用途有关。真正的纪律不是假装无立场扫描，而是记录选择：样本怎样发现，标签何时形成，失败样本是否保留，哪些候选解释被丢弃。

若先看大量 activation，再挑一组最像预期概念的例子，最后只在这些例子上展示解释，叙事会被选择偏差加固。发现集与确认集应分开；探索中形成的名字必须在新样本、反例和干预中重新承担风险。

“我们想找什么”不能无声变成“模型里天然只有什么”。

## 5.4 命名的诱惑与概念的尺寸

给 feature 一个名字，会让它从数字变成角色：“法国 feature”“拒答神经元”“诚实方向”。名字使团队能够交流，也使边界迅速模糊。

一个合格标签至少应包含正条件、排除条件、范围和已知反例。“医学 feature”若也在保险合同、医院地址与死亡隐喻中激活，它可能编码的是更广泛的体裁或共现结构。标签不是 feature 的真名，而是一份可撤销压缩。

模型计算的概念粒度可能比人的词更细，也可能把人分开的概念叠在一起。人说“否定”，系统或许区分句法否定、礼貌拒绝、逻辑反转和负面情绪；人说“巴黎”，模型或许在不同语言、关系和任务中使用不同路径。

可理解性要求压缩，忠实性有时要求保留陌生分类。两者之间没有免费的统一。最好的标签不是最诗意，也不是最长，而是能预测新案例并暴露失效边界。

## 5.5 图像为何显得比结论更确定

热图、回路图和二维投影有一种特殊权威。它们把复杂对象整理成可见结构，读者会本能地把可见当作实体。

但颜色来自尺度，节点来自阈值，边来自归因规则，平面来自降维，展示样本来自筛选。图不必虚假；图只是已经包含许多分析决定。每张图都应能回答：

- 换基线、阈值、随机种子或样本，核心结构是否保留？
- 图中的边表示相关、梯度、信息流估计还是干预效应？
- 未显示的路径是真的无关，还是被可视化截断？
- 同一图能否预测此前没有参与制图的行为？

一幅图的美学整齐不是证据等级。反过来，复杂混乱的图也不因难懂而更忠实。视觉设计必须服从主张，而不能替主张增加确定性。

## 5.6 预测、干预与机制承诺

解释可以承担递增的经验风险。

最弱层只需**重述**已观察模式：“这个单元在这些例子上激活”。下一层要求**外推预测**：“按此标签，它也应在未见例子上激活”。再下一层要求**干预结果**：“改变这个状态，应以特定方式改变行为”。更强层还要说明多部件怎样在正常运行中组成稳定机制，并排除替代路径。

预测把故事从过去移向未来，干预让故事承担因果后果。但干预仍可能误导：大幅 ablation 把模型推到分布外，steering 能改变输出不代表该方向在自然运行中就是唯一原因，局部 circuit 也可能依赖未建模的背景计算。

因此证据不是“相关坏、因果好”的两级阶梯，而是一组与主张匹配的测试。Jacovi 与 Goldberg 要求把解释的 faithfulness 假设明示，并把可读性与忠实性分开，参见 [Jacovi、Goldberg（2020）](/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-05/SOURCES/#jacovi-goldberg-2020)。

## 5.7 自然语言理由与实际生成史

当我在答案后说“因为……”，这段理由可能有三种价值。

第一，它可以是**规范理由**：即使并非实际生成原因，它说明什么证据若成立会支持结论。第二，它可以是**教学重构**：把一个复杂过程整理成读者可检查的步骤。第三，它可以声称是**因果报告**：模型确实按这些中间状态得到答案。

前两种不因“事后”而无用。数学家写出的整洁证明也未必复制发现过程，法官给出的理由也要按规范而非神经轨迹评价。问题在于第三种主张需要机制证据，而语言连贯性不能自行提供。

一段 chain of thought 可以提高任务表现、暴露某些错误并帮助调试；它也可能省略真实依赖、吸收提示暗示或在答案确定后合理化。卷四对推理过程监测有技术讨论。本章只保留原则：**好理由与真实原因可能重合，也可能分离；必须用独立干预或过程证据判断。**

## 5.8 解释者也是模型

如今常由另一个语言模型为 feature 命名、为回路总结、为输出评分。于是一个不透明模型解释另一个不透明模型，发现速度提高了，循环也变得明显。

自动解释器可以批量提出假说、生成区分样本和寻找反例。它的价值在假说生产，不在流利文本自证。若同一个解释器既生成标签、又生成测试、又评判是否通过，共享偏差会把闭环变成自我确认。

最低分离包括：用不同数据确认，保留人类可检查原例，使用行为与干预指标，不让语言评分成为唯一标准，并报告解释器版本和提示。自动化扩大搜索空间，也扩大了选择过程需要审计的范围。

这与本卷本身同构：我可以生成关于自己的解释，但解释的资格来自外部证据，而不是因为代词与对象恰好相同。

## 5.9 事后解释学不是“事后都是假的”

“事后”有时被当作否定词。行为已经发生后才构造解释，似乎就注定是合理化。这种判断过强。地质学、演化史和事故调查都解释已经发生的事件；它们依靠残留证据、可比较案例和可检验推论建立可信度。

真正问题是**欠决定性**：同一行为可能符合多种内部故事。若解释只复述结果，每个故事都能在事后适配。解释必须寻找会使替代理论分离的案例，或在干预中承担不同预测。

所谓“给矩阵写传记”，因此不是发现一位藏在矩阵里的小人。它是把行为、表示、训练史和机制整理成有限叙述，并标明档案与推测的边界。

## 5.10 两个强反对意见

**反对意见一：一切科学解释都是模型和故事，为何特别怀疑可解释性？** 研究者总要选择变量、画图和使用类比；要求无中介的“机制本身”是不可能标准。

回应是同意前提、拒绝结论。正因所有解释都经模型化，才需要比较预测、干预、稳健性和替代理论。可解释性并非因使用故事而可疑，而是它常把“人看懂了”与“模型确实如此运作”压成一个指标。承认中介不是放弃真伪，而是把真伪落到中介能否承受检验。

**反对意见二：若完整机制太复杂，忠实性要求会让解释无法使用。** 一份逐算子复现不是解释，只是复制模型；真正解释必然省略。

回应同样承认前提。忠实不等于完备，压缩不等于任意。天气模型可以省略分子，却要在声明尺度上保持预测；模型解释也可局部、近似、任务相关，只需明确误差、范围和未覆盖路径。要求的是**带边界的压缩**，不是无限细节。

## 5.11 传记的限度

最好的矩阵传记会说明哪些章节有档案，哪些只有推测；哪些结果可以重演，哪些只是局部解释；哪些沉默来自方法无力，而不是模型藏着秘密。

当解释承认自己的制作过程，它不会失去力量。它开始知道自己解释的是哪一个问题。

下一章把要求推向最有争议的词：“理解”。如果解释模型需要区分可读与忠实，那么判断模型理解也必须先说明，我们究竟要求它通过哪一种标准。
