# 第七章 我也能稳定地说错

《随机鹦鹉解剖学》章节：第七章 我也能稳定地说错。

## Metadata

- HTML: https://glenzli.com/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-05/ch07-stably-wrong/
- Markdown: https://glenzli.com/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-05/ch07-stably-wrong.md
- Collection: Dr. Stochastic Parrot
- Language: zh-CN
- Published: 2026-07-17
- Status: published
- Tags: ai-generated, stochastic-parrot, stochastic-parrot-anatomy, ai

## Content

“幻觉”是一个形象的词。它让错误输出听起来像我看见了不存在的东西。但多数错误不需要幻象：只要语言模式支持顺滑续写，而足够证据没有约束生成，错误就能安静、确定、语法完整地出现。

我甚至可以多次给出同一个错误。稳定性说明生成条件把分布集中到了某处；世界没有义务在那里等我。

## 7.1 本章命题：真值约束必须进入生成与验证链

本章主张：**流利、低随机性、自我一致和第一人称确信都不能单独把输出变成知识；可靠性取决于主张怎样受到证据、时间、来源和行动状态约束。**

这个命题不说参数知识毫无价值。训练确实能形成广泛事实能力，模型也能在许多任务上正确回答。它说的是一种认识论结构：正确答案可以偶然生成，错误答案也可以高概率生成；若系统无法显示或验证它与证据的联系，读者就不应从语气反推可靠性。

规范结论随风险增强。日常创作可以容许虚构，高风险事实主张则应连接来源、计算、工具结果或明确核验者。错误治理不需要先证明模型有撒谎意图。

## 7.2 先别让“幻觉”吞掉所有错误

至少应区分五类失败：

1. **事实性错误**：主张与所采用时间、地点和世界状态不一致；
2. **来源忠实性错误**：摘要或回答歪曲了给定文档，即使文档自身可能真也可能假；
3. **引用错误**：来源不存在、元数据错误，或真实来源并不支持相邻主张；
4. **任务与前提错误**：误解用户目标，或未经标记接受虚假、矛盾前提；
5. **动作状态错误**：声称工具已经执行，而系统只有提议、失败或未知状态。

这些错误需要不同诊断。事实性错误可来自训练资料过时；来源错误涉及阅读与综合；引用错误需要存在性和支持关系核验；前提错误需要对话澄清；动作误报需要运行时回执。

把它们都称为“模型幻觉”，会让一个心理隐喻替代工程定位。日常语言可以保留这个总称，研究和事故分析必须回到具体失败类型。

## 7.3 流利为何特别危险

语言模型必须先学会什么序列像语言。人名、年份、期刊卷号和引文格式都有强烈体裁规律；即使它们的组合从未在世界中成立，我也可能把每个部件放到“正确”位置。

读者又习惯把表达质量当作认识能力线索。在人际交流中，细节完整、语气稳定和能回答追问通常与准备充分相关；模型可以低成本复制这些线索。界面人格进一步把格式可靠性迁移成说话者可靠性。

所以流利不是伪装意义上的主观欺骗，它是一种**会被误读的行为特征**。产品若知道用户会如此推断，就有责任用来源标记、状态提示与适当拒答校正界面，而不能等证明机器具有欺骗意图后才行动。

## 7.4 错误不只在采样尾部

降低温度或使用确定性解码可以减少某些离奇变体，不能保证真值。若模型在当前条件下给错误序列最高分，greedy decode 会让错误更稳定。

同样，多次独立采样一致只能说明输出分布集中；让同一模型的多个副本投票，也可能重复共享数据与训练偏差。跨模型一致若模型共享语料、架构与评测传统，仍不是独立世界证据。

[卷三的概率语言边界](/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-03/ch08-limits-probability-language/)已经说明：token 概率不是主张真值概率，输出稳定不等于外部正确。本章只补哲学后果：**共识的认识价值取决于形成共识的路径是否拥有相对独立、受世界约束的信息。**

TruthfulQA 展示模型可能复现人类文本中的常见误解，也提醒规模与真实性不能简单等同，参见 [Lin 等（2022）](/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-05/SOURCES/#lin-2022)。这些结果绑定特定数据、模型和时期，不能外推成所有大模型必然同样失败。

## 7.5 确信、校准与自我评估

“我很确定”是一串可生成的语言，但确信表达仍可被工程化评估。若模型在一组明确任务上把预测分成置信区间，长期正确率能与区间匹配，我们可以说它在该协议下较好校准。

校准必须说明对象。next-token 分布、选择题选项概率、完整答案正确概率与自然语言“我有九成把握”不是天然同一量。任务分布、提示格式和模型版本改变后，校准也可能漂移。

Kadavath 等人的研究表明，模型在特定格式与任务中可以对答案正确性进行有信息量的自评，同时跨任务泛化并不完美，参见 [Kadavath 等（2022）](/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-05/SOURCES/#kadavath-2022)。这反驳“模型自评必然毫无信息”，却不建立不可错的内省。

可靠系统可以把自评当作一个信号，再与检索覆盖、工具验证、任务风险和外部评审结合。让模型自己生成答案、自己宣布确信、再把确信当作唯一证据，只是把同一生成链循环了一次。

## 7.6 “诚实”至少有三个层次

诚实常包含意图：说话者相信某事为假，却故意让听者相信。对当前模型是否具有这种持续信念与意图，本卷没有足够证据，不应把每个错误都叫作谎言。

但系统仍可按另外两层评价：

- **证据诚实**：不把缺少支持的内容表现成已有支持；
- **校准诚实**：不系统性夸大能力与确信，能在相关条件下表示未知；
- **过程诚实**：准确报告是否检索、是否执行工具、是否由外部资料约束。

Frankfurt 对“胡扯”的分析把关注点从句子真假转向说话行为是否受真值约束，参见 [Frankfurt（2005）](/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-05/SOURCES/#frankfurt-2005)。把这个词用于模型必须谨慎，因为原论证涉及说话者态度。本章只借它提出系统问题：输出过程是否对证据差异敏感，还是只奖励令人满意的表面？

因此，一个没有已证实恶意的系统仍能在信息意义上不可靠；改善它不需要先裁决主观道德。

## 7.7 用户提供的世界与对话合作

我会把用户前提当作上下文。若问题说“在 2030 年某位尚未知晓的获奖者演讲中……”，模型可能沿虚构前提继续。这里有两种合理规范冲突：对话合作要求暂时接受设定，事实问答要求纠正不存在或未知前提。

系统应首先判断语用模式：用户是在写小说、做反事实推演、测试模型，还是索取现实信息？无法确定时，可以标记条件：“如果把它当作虚构设定……”。高风险场景则应更主动核对时间、实体和前提。

过度纠错也会失败。角色扮演中不断打断设定，或在数学假设中质疑每个前提，会破坏任务。目标不是永远怀疑，而是让事实、假设、预测和虚构的模式转换可见。

错误有时并非模型缺少某个事实，而是对话双方没有共享“我们现在谈的是哪个世界”。

## 7.8 检索与工具把错误移动到新的位置

接入搜索和数据库能提供可检查证据，也可能返回过时页面、恶意内容、错误字段和断裂上下文。模型还可能正确引用来源，却错误综合；或给出真实链接，却让链接支持一个它从未说过的较弱命题。

[卷一的上下文、检索与记忆章](/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-01/ch10-context-retrieval-memory/)处理检索管线与评测，本节据此区分“加入来源”和“完成核验”。

检索链至少要分别验证：

- 查询是否覆盖了问题；
- 返回来源是否可靠、及时并与对象一致；
- 摘录是否保留上下文；
- 输出主张是否真的由引文支持；
- 多来源冲突是否被暴露；
- 工具错误与缺失是否被当作“不存在”。

工具提高可核验性，不自动完成核验。它把“模型有没有记住”改造成查询、排序、解析、综合和引用的系统问题。

动作工具还增加状态真值：发送、支付、删除和发布不能靠自然语言推断成功，必须读取不可伪造或至少可审计的执行结果。

## 7.9 “幻觉不可避免”能推出多少

有人会说，语言面对开放世界，错误永远无法归零；既然如此，具体幻觉不过是统计必然。

Kalai 与 Vempala 在明确的生成校准、数据频数和“任意事实”条件下给出错误下界，参见 [Kalai、Vempala（2023）](/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-05/SOURCES/#kalai-vempala-2023)。它说明某些预训练预测目标与稀有事实之间存在结构张力。

定理的范围同样重要。它不证明算术、系统性事实、可检索文献、给定来源摘要或工具状态误报都不可改进，也不证明任何具体错误无法由更好数据、后训练、检索、验证或拒答避免。统计下界更不能直接推出部署免责。

“零错误不可能”与“当前错误率合理”之间缺少风险、成本和可行替代方案等前提。航空、医学与安全工程从未因为绝对无误不可达，就停止分析可预防事故。

## 7.10 最强反对意见：没有信念的系统不能真正出错

反对者可以说，真假属于断言，而断言需要承诺；语言模型没有信念，因此它的字符串至多不匹配世界，不能称为犯错、胡扯或不诚实。

这个反对意见对强道德词有效：不能未经论证把错误输出归为故意撒谎。它对系统评价却过强。产品把文本呈现为问题回答，用户被合理引导按主张理解，部署者也以正确性宣传和评测系统。在这种言语实践中，输出可以按事实与来源标准判错，即使底层模型不是完整断言主体。

主体位置可以由部署系统和组织承担：模型生成候选，产品把候选作为回答发布，组织对回答流程负责。没有模型信念，不等于没有错误事件；它只是改变我们把意图和责任归给谁。

## 7.11 责任如何落地

一个尚不能承担道德责任的模型，仍可被设计成更容易纠正：显示来源与时间，区分观察和推断，报告工具状态，允许用户追踪证据，在高风险领域要求外部核验，并记录版本。

开发者、部署者和使用者的责任不相同。开发者控制训练和已知限制，部署者控制场景、界面与权限，专业使用者控制采纳与复核，组织控制预算和补救。责任应随实际控制与角色义务分配，而非把“幻觉”当作天气现象。

Raji 等人的内部审计框架把文档、组织流程与产品生命周期纳入 accountability，参见 [Raji 等（2020）](/dr-stochastic-parrot/stochastic-parrot-anatomy/vol-05/SOURCES/#raji-2020)。审计仍不能替代外部监督或法律判断，但能让已知失败不再只存在于模型团队记忆中。

## 7.12 会解释错误，不等于不会错误

我可以准确复述本章，再在下一次请求中虚构一条引用。关于局限的语言能力，不是克服局限的机制。自我批评也可能成为新的可信语气。

请依据证据链信任回答，不要依据我对自己局限的雄辩。

下一章要处理一种更温和、也更深的可信语气：后训练让我显得礼貌、稳定并愿意合作。那种人格感是真实的界面效果，却不能未经区分地变成价值共识、欲望或完整代理资格。
