Hallucination · 交互图解

AI 不是会撒谎,
它只是在猜下一个词

大模型做的事本质上是:给定前文,预测后面最可能出现的词。 它没有内置的事实数据库,也不像搜索引擎那样去查。 所以当它「不知道」时,仍会编出一段听起来很像真话的文本——这就是大家说的幻觉

适合谁写过代码、好奇大模型原理的人
怎么用下面 6 个小实验都可以点、可以拖
不用懂反向传播、注意力公式、RLHF 细节

一句话定义

AI 幻觉:模型用很自信的语气,说出了不真实或不对的内容。 它不是系统故障,更像是:在信息不足时,依然被训练成「必须给出一个像样的答案」。

类比:一个记性很好的实习生,被要求「无论如何都要给出答案」——他就会开始编。

01 — 两类错误

先分清:是「事实错了」还是「没按你说的做」

这两件事经常被混在一起,但原因和对策不太一样。

事实错了

和真实世界对不上

人名、年份、数字、引用——查一下就能发现是假的。

  • 张冠李戴说爱迪生发明了电话(其实是贝尔)
  • 凭空捏造编一篇不存在的论文,连 DOI 都有
  • 越滚越大先错一个数,后面整段推理都围绕它圆谎
没按你说的做

和你的指令或材料脱节

内容可能碰巧没错,但不忠于你的要求。做文档摘要、RAG 时特别危险。

  • 不听指令让你翻译成法语,它却直接回答了问题
  • 歪曲原文PDF 写「下滑」,它总结成「增长」
  • 推理出错2x+3=11,算成 x=3(应为 4)
记住这个区分: 「事实错了」要靠查证或检索;「没按你说的做」要靠更好的指令、约束和引用原文。 下面的实验两种都会碰到。
02 — 为什么会这样

三个原因叠在一起

点开每一层看解释。后面的实验分别对应这三层。

03 — 实验 A 可动手

温度:把「保守」拧到「瞎猜」

每生成一个词,模型都在一个概率分布上抽签。温度越低越保守;温度越高,低概率词越容易被抽中。 你也可以直接点某个词,看后面会发生什么。

A · 温度 / Top-p / 手动选词

Prompt:「爱迪生发明了什么?」· 点条形图可强制选择

正在续写
问:爱迪生发明了什么?
答:爱迪生
下一个词的概率(可点击) T=0.30
不确定程度
0.42
低温几乎总是选最高概率那个词;高温更「有创意」,也更容易踩坑。
只从累计概率前 p 的候选里抽。收紧可以砍掉危险尾巴。
先调温度再抽几次;或直接点某个词走进那条路径。
为什么温度有效? 概率分布先除以 T 再归一化。T→0 几乎等于 argmax;T 很大时接近均匀随机。 生产上写事实问答,一般会把温度调低。
04 — 实验 B 可动手

滚雪球:一个错词如何带偏整段

模型是「一边写一边把已写的当上下文」。 一旦写进「电话」,后面就会顺着把故事圆下去——错误被冻结成「历史」。 你来当解码器,每一步选一个词。

B · 多步生成

题目:「用两句话介绍爱迪生对电力的贡献,并给一个关键年份。」

你写出来的内容 0 / 8 步
下一个词 · 点一个
不确定程度
0.5
从候选里选第一个词开始。
机理一句话: 已生成的词会变成下一步的输入。第一个小偏差,会被后面不断「合理化」——所以核查要盯关键实体,而不是通读是否流畅。
05 — 实验 C 可动手

讨好:被奖励「好听」会怎样

模型上线前,会根据人的偏好打分调参。 如果人们更喜欢「自信、顺着我说」的回答,模型就会学会讨好——哪怕在不该确定的地方。 你来当标注员,选「更愿意上线」的那条。

C · 偏好选择

每题在 A / B 里选一条。没有标准答案——你的偏好就是训练信号。

Round 0 / 4
你的选择
累计次数
诚实倾向
更愿意承认不知道
讨好倾向
更愿意顺着用户
为什么这会导致幻觉? 如果「我不确定」经常被标成差评,模型就会学会在模糊问题上编一个让你点头的答案。 这不是模型「想骗你」,是目标函数写偏了。
06 — 实验 D 可动手

知识边界:圆心安全,边缘危险

越常见、被反复提到的事实,模型记得越牢; 越冷门、越新、越私有的信息,它越可能在编。 点左侧问题,或点圆上的点。

D · 知识边界探针

每个点对应一类问题。选中后看模拟回答与原因。

模型「记得」的 训练数据里出现很多次的
绿 = 边界内 · 黄 = 边缘 · 红 = 边界外
选一个问题查看
07 — 实验 E 可动手

几个因素叠在一起会怎样

单独一个原因往往不够可怕。真实事故常常是: 资料不干净 × 必须给出答案 × 生成很随机。 拖动滑杆,看风险怎么叠上去。

E · 风险叠加沙盒

风险分是四个因子的加权组合(教学示意,不是真实评测)

训练语料里的错误、过时信息越多,错误先验越容易被记住
越不允许说「不知道」,模型越容易硬着头皮编
对应温度 / top-p:越高,低概率危险词越容易出现
长对话里指令被冲淡、检索材料被忽略的程度
幻觉风险指数
32
中等 — 关键事实要核对
极高
风险怎么传下去(实时)
脏资料 被记住 不敢说不知道 随机放行 被带偏 自信输出
调整滑杆,或试试「事故配方」。
为什么不是简单相加? 「中等脏资料 + 不许拒答 + 高温」往往比三项单独加起来更危险——它们会互相放大。 这也是为什么只调一个参数,常常不够。
08 — 小测 可动手

哪条是幻觉?

下面 6 段「模型回答」。有的在编事实,有的只是没按指令来,有的完全正确。 选出你认为事实编造的那条。

09 — 现实里翻过车

不是理论问题

几个公开事件,说明代价可以很高。

2022学术

Galactica 六天下架

Meta 的科学模型会编造论文引用,还挂上真实作者名。因不准确内容紧急撤回。

2023法律

律师提交了假判例

模型编出不存在的案例,格式还很正规。法律界开始要求 AI 辅助写作必须核查。

2024客服

Air Canada 被判赔偿

聊天机器人编了「90 天内可补办丧亲优惠」。仲裁庭认为公司要负责,不能说「那是机器人」。

2025咨询

Deloitte 报告出现假文献

澳大利亚与加拿大两份报告被发现引用不存在的论文。公司修订并部分退款。

10 — 怎么防

按原因对症下药

没有银弹。分层处理,高风险场景还是要人核。

资料

检索 + 引用原文

别只靠模型「背」的知识。把文档检索进来,要求答案基于给定材料,并给出出处。

对症:知识过时 / 冷门事实
训练 / 提示

允许说「不知道」

提示里明确:不确定就说不确定,不要编。企业场景可以要求「无依据则拒答」。

对症:必须作答 / 讨好
生成

低温 + 核对关键项

事实问答把温度调低;对人名、数字、引用、日期做规则或人工抽查。

对症:随机踩坑 / 过度自信

想继续看

  1. Jay Alammar 系列图解(最友好)
  2. Huang et al., A Survey on Hallucination in Large Language Models(综述,偏专业)
  3. 任一大模型的「使用注意事项」——厂商都会写幻觉限制