系列第 5 篇 / 共 5 篇:理解训练收敛和泛化的边界。
一句话:训练过程确实收敛,但收敛是算法层面的事(优化),不是知识层面的事(逼近真相)。
这是深度学习里最容易被误解、也最颠覆直觉的一个点。
一、先纠概念:函数没有"收敛",是"序列"在收敛
数学上,"收敛"说的是一串数越来越靠近某个极限。
训练里"收敛"是手段,"取到极值(损失最小)"是目标。
二、关键问题:这个极值能不能"解出来"?
你可能想说:收敛的函数应该是"闭合"的、能直接写出答案。这对应数学里的闭式解(closed-form solution)。
所以答案恰好相反:大模型的训练不是"闭合地解出来",而是"开放地一步步爬过去"。 收敛的是迭代路径,不是能写出的公式。
三、它收敛到的是什么?
梯度下降收敛到驻点(梯度 = 0 的点):
| 函数类型 | 驻点 = ? |
|---|---|
| 凸函数(如 x²) | 全局最小(唯一) |
| 神经网络(非凸) | 大量局部极小值,甚至鞍点 |
好消息(2018 年被数学证明):当过参数化(参数远多于数据量)时,高维损失景观非常"友好"——好点被盆地连起来、坏坑极稀少。梯度下降几乎总能收敛到和全局最优差不多好的点。这就是大模型"总能训练得动"的理论依据。
四、"越来越准确"是最大的坑:收敛 ≠ 泛化
训练收敛到的是"在这批训练数据上误差最小的函数",不等于逼近真相。
经典实验(Zhang et al., 2017):把训练集标签彻底随机打乱(猫的照片标成狗),神经网络照样把训练损失收敛到接近 0——它把随机标签也一字不差背下来了。
结论:
类比:大雾天摸黑下山找谷底。你摸到一片平地就停下(收敛),但你不确定这是不是整座山最低的谷(局部极小),而且这张"地图"是训练数据不是真实世界——这块平地下雨时会不会淹(泛化),下山时根本看不出来。
2018 年的理论证明了:这座山形状很好,好谷多、坏坑少,随便摸索也能到不错的谷底。
五、相关论文清单("讲收敛"的那些论文)
按理解顺序推荐:
入门建议:从 Zhang 2017 和 Du 2018 入手——前者颠覆三观,后者给你数学保证,都相对好懂。
六、一句话总结
训练里的"收敛"是算法层面的(优化过程趋于驻点),不是知识层面的(逼近真相)。
它给你的是"在训练数据上误差最小的一个函数";至于它对新数据准不准,那是泛化的战场——那才是大模型真正"玄学"的地方。
评论
可以留下你的想法。评论提交后会进入审核,通过后公开展示。