模型把训练题背得滚瓜烂熟,遇到新题却一塌糊涂,这是机器学习最常见的失败。正则化就是一组专门对抗死记硬背的技巧。本文讲清权重惩罚与 Dropout 的思路差异,以及使用时容易踩的坑。

核心要点

  • 正则化通过限制模型复杂度,换取在未知数据上的稳定表现。
  • 权重惩罚让参数整体变小,抑制个别特征带来的极端影响。
  • Dropout 训练时随机停用部分神经元,迫使网络不依赖少数节点。

死记硬背是怎么发生的

学生把整本习题集的答案背下来,考试换了数字就不会做了。模型也一样:参数足够多时,它可以把训练样本的每个细节甚至噪声都记进参数,训练集上表现完美,遇到新数据却一塌糊涂。这种记住而非学会的状态,就是过拟合。

判断它是否发生,最常用的办法是留一部分数据不参与训练,只用来检验。训练表现越来越好、验证表现却开始下滑,就是明确的信号。应对手段有很多:增加数据量、简化模型、提前停止训练,以及我们这里要说的正则化——给模型的自由度设限。

给模型戴上紧箍咒

最常用的是权重惩罚:在原本的误差目标上再加一项,惩罚绝对值过大的权重。直觉上,权重越大意味着模型对某些特征越敏感、曲线越扭曲,越容易钻进数据的犄角旮旯。加上惩罚之后,模型被迫用更平缓的方式拟合,泛化能力通常随之改善。

还有一类思路是提前停止:训练时不断观察验证表现,一旦发现不再改善就收手。它不改动目标函数,只是限制优化跑得太远。数据增强也属于广义的正则化——通过旋转、裁剪、加噪等方式扩充样本,等于告诉模型这些变化不该影响判断,从而减少死记硬背的机会。

Dropout:随机让一部分人缺席

Dropout 的做法很有意思:每次训练随机挑一部分神经元临时停用,让它们这次不参与前后向计算。于是网络不能依赖某几个主力神经元,必须让更多路径都能担事。这相当于每次都在训练一个略有不同的子网络,最终效果近似于把许多网络集成起来。

使用时有个容易踩的坑:训练时随机关掉一部分神经元,输出的整体尺度会变小,推理时却不关,尺度对不上。常见的处理是在训练时把保留下来的输出放大到原来的量级,让两个阶段保持一致。另外要注意,测试阶段必须关掉它,否则结果会随机波动。

常见问题

正则化会让模型变差吗?

约束过强确实会让模型连基本规律都学不会,表现为训练集和验证集上的表现一起变差。所以正则化强度是需要调的参数,通常先用较小的值,观察验证表现再逐步加大。找到训练表现略降、验证表现最高的那个点,往往就是合适的强度。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。