和真实世界对不上
人名、年份、数字、引用——查一下就能发现是假的。
- 张冠李戴说爱迪生发明了电话(其实是贝尔)
- 凭空捏造编一篇不存在的论文,连 DOI 都有
- 越滚越大先错一个数,后面整段推理都围绕它圆谎
大模型做的事本质上是:给定前文,预测后面最可能出现的词。 它没有内置的事实数据库,也不像搜索引擎那样去查。 所以当它「不知道」时,仍会编出一段听起来很像真话的文本——这就是大家说的幻觉。
AI 幻觉:模型用很自信的语气,说出了不真实或不对的内容。 它不是系统故障,更像是:在信息不足时,依然被训练成「必须给出一个像样的答案」。
类比:一个记性很好的实习生,被要求「无论如何都要给出答案」——他就会开始编。
这两件事经常被混在一起,但原因和对策不太一样。
人名、年份、数字、引用——查一下就能发现是假的。
内容可能碰巧没错,但不忠于你的要求。做文档摘要、RAG 时特别危险。
点开每一层看解释。后面的实验分别对应这三层。
每生成一个词,模型都在一个概率分布上抽签。温度越低越保守;温度越高,低概率词越容易被抽中。 你也可以直接点某个词,看后面会发生什么。
Prompt:「爱迪生发明了什么?」· 点条形图可强制选择
模型是「一边写一边把已写的当上下文」。 一旦写进「电话」,后面就会顺着把故事圆下去——错误被冻结成「历史」。 你来当解码器,每一步选一个词。
题目:「用两句话介绍爱迪生对电力的贡献,并给一个关键年份。」
模型上线前,会根据人的偏好打分调参。 如果人们更喜欢「自信、顺着我说」的回答,模型就会学会讨好——哪怕在不该确定的地方。 你来当标注员,选「更愿意上线」的那条。
每题在 A / B 里选一条。没有标准答案——你的偏好就是训练信号。
越常见、被反复提到的事实,模型记得越牢; 越冷门、越新、越私有的信息,它越可能在编。 点左侧问题,或点圆上的点。
每个点对应一类问题。选中后看模拟回答与原因。
单独一个原因往往不够可怕。真实事故常常是: 资料不干净 × 必须给出答案 × 生成很随机。 拖动滑杆,看风险怎么叠上去。
风险分是四个因子的加权组合(教学示意,不是真实评测)
下面 6 段「模型回答」。有的在编事实,有的只是没按指令来,有的完全正确。 选出你认为事实编造的那条。
几个公开事件,说明代价可以很高。
Meta 的科学模型会编造论文引用,还挂上真实作者名。因不准确内容紧急撤回。
模型编出不存在的案例,格式还很正规。法律界开始要求 AI 辅助写作必须核查。
聊天机器人编了「90 天内可补办丧亲优惠」。仲裁庭认为公司要负责,不能说「那是机器人」。
澳大利亚与加拿大两份报告被发现引用不存在的论文。公司修订并部分退款。
没有银弹。分层处理,高风险场景还是要人核。
别只靠模型「背」的知识。把文档检索进来,要求答案基于给定材料,并给出出处。
对症:知识过时 / 冷门事实提示里明确:不确定就说不确定,不要编。企业场景可以要求「无依据则拒答」。
对症:必须作答 / 讨好事实问答把温度调低;对人名、数字、引用、日期做规则或人工抽查。
对症:随机踩坑 / 过度自信