目录55 / 17

AI 为什么会?⑤ AI 为什么不会说"我不知道"?

上一篇,我们调查了一个很多人都听过,却很少真正理解的问题。

为什么预测下一句话,会产生智能?

最后,我们发现,大模型直接预测的是 Token,而支撑预测的,是训练形成的知识、记忆和规律。那么,一个新的问题来了,既然它已经学到了这么多东西,为什么还会犯一些看起来非常低级的错误?更准确地说:

为什么它不会直接告诉你:"对不起,我不知道。"


调查现场

今天,请你打开 ChatGPT。不要问它数学题,也不要让它写代码。问一个只有你自己知道答案的问题。例如:

我昨天晚饭吃了什么?

或者:

我的办公室有几把椅子?

大多数模型都会告诉你:

我不知道。

很好,现在,请换一种问题。例如:

《红楼梦》第 121 回里,贾宝玉是不是说过:"人生最大的遗憾,就是错过真正爱你的人?"

如果你没有读过《红楼梦》,很难判断这句话是真是假。很多 AI 会开始一本正经地分析人物、情节,甚至引用根本不存在的内容。看到这里,你可能会觉得奇怪,刚才那个问题,它会说不知道,为什么现在,它又开始"编"了?


一、它到底是在什么时候决定回答的?

这是我一直想不通的问题,人类回答问题之前,脑子里通常会多一个步骤。别人问我:

去年巴西的咖啡出口量是多少?

我的第一反应不是回答,而是先判断:

我知道吗?

如果不知道,我会直接说:

不知道。

这是一个我们每天都在做、却几乎意识不到的过程。

先判断自己知不知道。

然后,才决定要不要回答,于是我开始想,ChatGPT 会不会也是这样?它是不是也会先判断:

"这个问题我会。"

或者:

"这个问题我不会。"

我原以为答案很简单:没有。AI 根本不会先问自己会不会。

可继续查下去,我发现这句话又走到了另一个极端。它不是完全不会判断,而是这种判断没有我们想象得那么可靠。


二、它不是没有开关,而是开关不够可靠

上一篇我们已经知道,大模型会通过生成形成答案。请注意,“我不知道”本身也是一句可以生成的话。经过专门训练的模型,确实会拒绝猜测,也可能在回答前检查自己。

真正的问题是:预训练的基本任务,是预测接下来最可能出现什么,并不是替每一个事实挂上一盏准确的信号灯——绿色表示确定,红色表示不知道。

于是,即使内部存在不确定信号,它们也不一定会可靠地变成一句:

我会不会?

我不知道。

模型可以学会拒答,也可以估计把握有多大,但这个开关需要专门训练和产品规则来加强,而且仍然可能按错。


三、它能表示不确定,却不一定表示得准

后来,我想到一个很形象的比喻。假设你参加一场考试,看到一道不会做的题,通常有两种选择。第一种,老老实实写:

不会。

第二种:尝试猜一下,但心里很清楚。

我是在猜。

AI 有没有类似人的主观体验,我们不知道。因此,不能替它宣布“它心里很清楚自己在猜”,也不能断言“它完全不知道自己是否知道”。我们能够观察到的是:它有时能找出自己的错误,换一道题却又会信心满满地答错。

真正的问题不是它有没有任何不确定信号,而是:

这些信号能不能稳定对应答案的真假。


四、这才是问题真正的源头

很多人会说:

AI 会一本正经地胡说八道。

以前,我也觉得这是 AI 最大的缺点。后来我发现,这其实只是一个结果,真正的问题发生得更早。

后来我发现,一个重要线索藏在考试规则里。

它的训练和评价方式,常常更奖励“给出答案”,而不是“承认不确定”。

如果猜一个答案,偶尔还能得分;如果永远回答“不知道”,在许多只看答案的考试里一定是零分。这样的训练环境,很容易让系统形成一种倾向:证据不足时,也先试着回答。

当然,这不是唯一原因。事实太罕见、问题有歧义、材料拿错了、推理走偏了,都可能造成错误。但这条线索解释了一个关键现象:为什么“说得出来”和“知道自己说得对不对”,是两种不同的能力。

我们平时看到的"胡说八道",其实只是更深层原因的表象。


五、今天,我们先停在这里

如果你理解了今天这一篇,那么下一篇的很多现象,就都能解释了。为什么 AI 会引用不存在的论文?为什么会编造不存在的法律条文?为什么会虚构一本根本没有出版过的书?这些都不是独立的问题,它们都有同一个源头。

AI 可以表达“不知道”,但它对自己是否知道的判断,并不天然可靠。

于是,一个新的问题自然出现了,如果它一直在生成,为什么有时候会生成正确答案,有时候却会生成一本正经的错误答案?它到底是依据什么来"猜"的?


调查笔记 No.5

今天,我们推翻了第五个认知。

⚠️ AI 会像一个可靠的人一样,准确判断自己知不知道,然后再回答。

AI 可以拒答和自我检查,但这种不确定性判断需要专门训练,也可能失准。

真正的问题不是它永远不会说“不知道”,而是:

我们不能把它说“不知道”或者说得很自信,直接当作真实置信度。


当前掌握的线索

  • AI 的回答来自模型训练形成的能力,以及当前 Context。
  • 模型直接预测 Token,也能在最终回答前进行额外推理。
  • AI 既可能记住,也可能归纳规律。
  • AI 可以表达不确定,但不一定校准得准确。

下一步调查

如果 AI 不会判断自己知不知道。那么,

为什么它有时候猜得那么准,有时候又会一本正经地胡说八道?

下一篇,我们继续调查。

《AI 为什么会?⑥ AI 为什么会一本正经地胡说八道?》