为什么模型不是越复杂越好?偏差-方差分解给出了答案:预测误差可以拆成偏差、方差和不可约噪声三部分。本文用打靶的四种情形讲清偏差与方差的含义,说明它们与过拟合欠拟合的对应关系,并解释集成方法为何能压低方差。

核心要点

  • 偏差是平均预测的偏离,方差是对训练数据变化的敏感程度
  • 模型越复杂,偏差越低而方差越高
  • 集成学习通过平均多个模型来降低方差

打靶的四种情形

把模型比作打靶。偏差是弹着点整体偏离靶心的程度,也就是瞄歪了;方差是每换一批训练数据,弹着点就大幅漂移的程度,也就是手抖。一个好模型要既瞄得准又稳得住,可惜这两件事常常互相拉扯。

四种典型情形:低偏差低方差,弹点紧聚靶心,理想;高偏差低方差,弹点很集中却整体偏了,像一把没校准的枪;低偏差高方差,弹点围绕靶心却散得满靶都是;高偏差高方差,又偏又散,最糟。

复杂度如何两头拉扯

模型越简单,比如用一条直线去拟合弯曲的规律,它的假设强、受数据影响小,于是偏差高、方差低,对应欠拟合;模型越复杂,能贴合各种形状,却也把训练数据的偶然波动一并学了去,于是偏差低、方差高,对应过拟合。

第三项是不可约噪声,来自数据本身的随机性与未被观测的因素,无论多好的模型都消不掉。比如成交价里包含买卖双方当时的心情,这部分永远无法预测。听到误差为零的宣传时,想想这一项就知道那多半是幻象。

集成为什么有效

有什么办法能同时改善两头?集成学习给出了一条路:训练多个模型,把它们的预测平均或投票。各个模型犯的错误彼此相对独立,平均之后相互抵消,方差因此显著下降,而偏差基本不变,随机森林就是这个思路的代表。

提升类方法则走另一条路:让新模型专门去补前面模型没做好的样本,逐个累加,主要压低偏差。理解偏差与方差的来源,你就能判断下一步该加数据、该换模型还是该做集成,而不是盲目调参。

常见问题

加数据能同时降低偏差和方差吗?

主要降低方差。数据越多,模型越不容易被个别样本的偶然波动带偏,换一批数据训练出来的结果也更稳定。但如果模型本身太简单,规律根本表达不出来,加再多数据也降不了偏差,这时需要换更复杂的模型或补充更有效的特征。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。