系列第 2 篇 / 共 5 篇:理解它为什么会输出这些内容。

一句话:因为它是一个巨大的"条件概率"模型——它学的不是知识,而是"什么词通常接在什么词后面"的统计规律。

一、本质:一个条件概率函数

模型在数学上学的本质是:

P(下一个词 | 前面所有的词)

读作:"给定前面所有词的情况下,下一个词的概率是多少"。

  • 输出不是一个确定答案,而是一份概率清单(词表里每个词的概率)
  • 推理时按概率采样选出下一个词,再拼回去继续算
  • 所以它不是"想"出来的,是"猜"出来的——猜得准,是因为读得多

二、这个"概率"是从哪来的?

训练的时候,模型见过天文数字的文本(网页、书籍、代码……),相当于把"中文/英文里哪些词通常接在哪些词后面"这种统计规律,全压缩进了参数里。

例子:

训练数据里 "猫" 后面经常跟 "在"、"是"、"喜欢"
→ 模型学到:P(在 | 猫) 很高,P(飞机 | 猫) 很低

推理时你输入"猫在____",它会激活训练时形成的相关模式,给出"屋顶 / 树上 / 沙发"这类高概率的词。

推理 = 模式激活:你的输入唤醒了参数里相关的统计模式,模型按这些模式去续写。

三、为什么它看起来"懂"?

因为训练数据太庞大,模式太丰富,导致"接词"在宏观上看起来像"思考":

  • 见过无数"问题→推理→结论",它学会续写出像推理的文本
  • 见过无数"代码→运行→报错→修复",它学会续写出能跑的代码
  • 规模跨过某个门槛后,涌现出"会推理、会写代码"等小模型没有的能力

但要清醒:这是"统计上最像样",不是"逻辑上真理解"。它从没"体验"过真实世界,只是把见过的文字模式缝合在一起。

四、幻觉从哪来?(重要推论)

因为它是"概率续写"而不是"查证事实",所以:

  • 遇到没见过、或训练数据里本身就矛盾的知识 → 它会一本正经地编一个概率上最像话的答案
  • 它输出的流畅程度与真实程度无关——越流畅不代表越正确

类比:一个背了全世界文章但从不核对事实的"接词大师"。你问它没背过的问题,它会用最像样的口气编一段。

五、小结

环节实际发生了什么
训练海量文本里学"词与词的统计规律",压缩进参数
推理输入输入激活参数里相关的模式
推理输出按条件概率 P(下一个词 \前文) 采样,循环生成
它的本质模式匹配 + 概率生成,不是真理解、真查证
副作用幻觉(编造)、偏见(来自训练数据)、过时(知识截止)

一句话收尾:它输出什么,不是"想"出来的,是"按概率续写"出来的——只是规模大到,这个接词游戏聪明得像是思考。

评论

可以留下你的想法。评论提交后会进入审核,通过后公开展示。