系列第 3 篇 / 共 5 篇:补上参数是怎么训练出来的。
一句话:训练 = 反复做"猜下一个词"的考试,答错了就把所有参数朝"下次能答对"的方向调一点点。
核心四步:前向传播 → 算损失 → 反向传播 → 梯度下降。然后三阶段:预训练 → SFT → RLHF。
一、参数是什么?
参数 = 网络里所有权重矩阵中的数字,包括:
词嵌入表(embedding 矩阵)
Q、K、V 三个投影矩阵 × 多头 × 每层
FFN 的两层权重
LayerNorm 的参数
最后的输出线性层二、一次训练循环(核心四步)
① 前向传播(forward)
给模型一段真实文本,让它在每个位置猜下一个词。 例如给它"猫在屋顶__",它给 10 万个候选词各自打分,"上"只得了 0.02。
② 算损失(交叉熵 loss)
把预测分布和真实答案对比,算"差多少":
真实答案概率 0.9 → loss ≈ 0.1 (猜得准,损失小)
真实答案概率 0.01 → loss ≈ 4.6 (猜得离谱,损失大)
loss = -log(模型给正确答案的概率)损失 = 模型对自己预测的惊讶程度。对正确答案越不惊讶,损失越小。
③ 反向传播(backprop)
现在有一个损失数字,要回答:上万亿个参数里,每一个如果动一丁点,损失是变大还是变小?多剧烈?
④ 梯度下降(gradient descent)
每个参数沿梯度的反方向(下坡方向)挪一小步:
新参数 = 旧参数 − 学习率 × 梯度类比:大雾天摸黑下山。 你看不见全局,只能感觉脚下坡度(梯度 = 最陡的上升方向),就朝相反方向迈步。
学习率 = 步子大小:太大容易左右横跳跨过谷底;太小走得太慢。
⑤ 分批重复
三、三阶段训练(为什么"能听话")
| 阶段 | 干什么 | 学到的 | 费用 |
|---|---|---|---|
| 预训练 | 全网文本(网页/书/代码)上猜下一个词 | 语言、知识、模式——"会说话" | 最贵(几千张 GPU 跑几个月) |
| SFT 指令微调 | 用人写的"问题→回答"对微调 | 听指令——"听话" | 中 |
| RLHF 人类反馈 | 生成多份回答,人类排序打分,训练奖励模型,用强化学习(如 PPO)强化高分行为 | 安全、贴人味、不瞎说——"讨人喜欢" | 中 |
一句话:预训练给了它"知识",SFT 给了它"能力",RLHF 给了它"人品"。
补充:2026 年出现 GRPO(DeepSeek-R1 用),证明纯强化学习、不靠人工标注思维链也能训练出长推理能力;Anthropic 则用 Constitutional AI(宪法式 AI)做对齐。
四、规模效应:为什么越大越强
参数、数据、算力同时变大,模型会涌现出小模型没有的能力(推理、写代码、创作)。
五、一张图收尾
海量文本 → 分词 → 向量化 → Transformer → 输出"下一个词"概率分布
│
与真实下一个词对比 → 损失(loss) ←─┘
│
反向传播:算出每个参数的梯度(谁该为错误负责)
│
梯度下降:每个参数沿下坡方向挪一小步(学习率×梯度)
│
反复几十万步 → 参数收敛 → 模型学会"语言规律"核心一句话:训练 = 猜词考试 + 错了就反向微调所有参数,直到猜得准。推理 = 参数冻结,只算一遍。
评论
可以留下你的想法。评论提交后会进入审核,通过后公开展示。