科创科普:AI 为什么「一本正经地胡说」?——大模型的「幻觉」与三招防坑

一、先看一个真实的「翻车现场」 小宇在做科学作业时问AI:「水的沸点是多少?」AI回答「100℃」;他又问:「在珠穆朗玛峰顶呢?」AI答:「大约70℃,因为海拔每升高1000米沸点下降约3℃。」这一次是对的。可当他问「我们学校游泳馆的水几度沸腾」时,AI竟然认真地说:「水温18℃时沸腾。」——水温18℃怎么可能沸腾?这句话语法通顺、语气笃定,却是彻底的胡说。这种现象在人工智能领域有个专门的名字:幻觉(Hallucination)。它不是AI「坏了」,而是它的工作原理决定的一种常见现象。

二、AI是怎么「说」出一句话的:概率接龙 大语言模型的本质不是「查资料」,而是「接龙」。它先把你的问题切成一串「词块」(英文叫token),然后根据海量文本中学到的统计规律,一个词一个词地预测「下一个最可能出现的词」。 比如输入「今天天气真」,模型算出来:好(62%)、不错(18%)、热(9%)……于是它挑了「好」。接着在「今天天气真好」后面继续预测下一个词。整段回答就是这样一句一句「接」出来的。 关键点在于:它优化的目标是「说得像人」,而不是「说得对」。对模型来说,「水温18℃时沸腾」和「在标准大气压下是100℃」在语言形态上一样流畅,它未必分得清哪句在物理上成立。流畅 ≠ 正确,这是理解幻觉的第一把钥匙。

三、幻觉从哪来:三个主要原因 1. 知识有截止日期。模型的训练数据到某个时间点就停了,之后的新闻、新赛事规则、新教材改动它一概不知。你问它「今年新出的赛事报名时间」,它只能靠猜。 2. 概率会「补齐」空白。当你问到很细的内容(某个县的报名入口、某本书第几页的原文),训练数据里可能根本没有,但模型不允许自己「不说」,于是用最像的模板补出一个答案。就像不会做的题硬凑一个解,还写得工工整整。 3. 记忆是「模糊压缩」的。模型不是把整本书原样存进硬盘,而是把文字压缩成参数。细节会被磨平:人名、数字、年份最容易串位,这正是「引用文献」和「具体数据」最容易出错的地方。

四、案例:一次错误是怎么发生的 题目:请问「光的折射」这个知识点一般出现在哪个年级的课本里? AI回答:「小学三年级下册第三单元。」——听起来很具体,但这就是典型的幻觉:它把「确实有这一课」和「具体在哪一册哪一单元」混在一起编了出来。不同版本教材编排完全不同(人教版、苏教版、北师大版),模型无法同时掌握所有版本,却给出了一个唯一答案。 正确做法是:把AI的回答当作「线索」而不是「结论」,再到课本目录、教材官网或老师那里核对。

五、防坑三招(学生和家长都用得上) 第一招:要求给依据。提问时加一句「请说明你的依据,如果是你不确定的内容,请直接说不确定」。这会明显降低它硬编的概率。 第二招:关键信息交叉验证。数字、年份、人名、地址、赛事规则,一律去官方渠道(政府或学会官网、教材、学校通知)核对一遍。凡是「越具体越要查」,这是最容易出错的地方。 第三招:分步追问,让它「露馅」。先问结论,再问「为什么」「依据是什么」「有没有例外」。真懂的内容经得起追问,编出来的内容往往第二问就开始前后矛盾。

六、练习 1. 判断题:AI说得很流畅、很有条理,所以内容一定正确。(答案:错。流畅只说明它「接得好」,不说明「说得对」。) 2. 实践题:问AI三个问题——「我们省青少年科技创新大赛的报名截止日期」「今年白名单赛事一共有多少项」「《西游记》第六回讲了什么」,然后逐条去官网或课本核对,记录哪几条是幻觉。 3. 思考题:如果AI的优化目标是「说得像人」,那么它会不会为了让答案更像人而主动编造数字?请举出一个你亲历的例子。 4. 拓展题:请给「防幻觉」设计一句你自己的提问模板,要求包含「依据」「不确定就说不确定」「分步骤说明」三个要素。

七、一句话总结 AI是一个极其擅长「接话」的语言高手,不是一个永远正确的百科全书。会用它的人,不是问什么都信的人,而是懂得「用它的效率、用自己的核对」的人。