系列第 2 篇 / 共 5 篇:理解它为什么会输出这些内容。
一句话:因为它是一个巨大的"条件概率"模型——它学的不是知识,而是"什么词通常接在什么词后面"的统计规律。
一、本质:一个条件概率函数
模型在数学上学的本质是:
P(下一个词 | 前面所有的词)读作:"给定前面所有词的情况下,下一个词的概率是多少"。
二、这个"概率"是从哪来的?
训练的时候,模型见过天文数字的文本(网页、书籍、代码……),相当于把"中文/英文里哪些词通常接在哪些词后面"这种统计规律,全压缩进了参数里。
例子:
训练数据里 "猫" 后面经常跟 "在"、"是"、"喜欢"
→ 模型学到:P(在 | 猫) 很高,P(飞机 | 猫) 很低推理时你输入"猫在____",它会激活训练时形成的相关模式,给出"屋顶 / 树上 / 沙发"这类高概率的词。
推理 = 模式激活:你的输入唤醒了参数里相关的统计模式,模型按这些模式去续写。
三、为什么它看起来"懂"?
因为训练数据太庞大,模式太丰富,导致"接词"在宏观上看起来像"思考":
但要清醒:这是"统计上最像样",不是"逻辑上真理解"。它从没"体验"过真实世界,只是把见过的文字模式缝合在一起。
四、幻觉从哪来?(重要推论)
因为它是"概率续写"而不是"查证事实",所以:
类比:一个背了全世界文章但从不核对事实的"接词大师"。你问它没背过的问题,它会用最像样的口气编一段。
五、小结
| 环节 | 实际发生了什么 | |
|---|---|---|
| 训练 | 海量文本里学"词与词的统计规律",压缩进参数 | |
| 推理输入 | 输入激活参数里相关的模式 | |
| 推理输出 | 按条件概率 P(下一个词 \ | 前文) 采样,循环生成 |
| 它的本质 | 模式匹配 + 概率生成,不是真理解、真查证 | |
| 副作用 | 幻觉(编造)、偏见(来自训练数据)、过时(知识截止) |
一句话收尾:它输出什么,不是"想"出来的,是"按概率续写"出来的——只是规模大到,这个接词游戏聪明得像是思考。
评论
可以留下你的想法。评论提交后会进入审核,通过后公开展示。