人工智能很少给出绝对判断,更多是“有多大可能”。这种思维的数学基础是贝叶斯定理:用新证据更新原有判断。本文用一个疾病检测的反直觉例子,讲清先验、似然、后验三个概念,以及朴素贝叶斯分类器如何把这个思想用在文本分类上。
核心要点
- 贝叶斯定理描述如何用新证据更新原有判断的概率
- 基础概率很低时,即使检测准确率高,阳性结果也未必可靠
- 朴素贝叶斯假设特征条件独立,是经典的文本分类方法
先验、似然与后验
日常生活中我们常说“这么晚还亮着灯,八成在家”,这就是在更新判断:先有一个初始估计,看到新信息后修正它。贝叶斯定理把这个过程写成了一个极简公式:后验概率正比于先验概率乘以似然。
三个词对应三件事。先验概率是看到证据之前你相信的程度;似然是如果假设成立,看到这个证据的可能性有多大;后验概率是看完证据之后更新过的相信程度。公式的形式并不难,难的是把现实问题正确翻译成这三个量。
一个反直觉的例子
经典例子是疾病检测。某情况在人群中的比例是千分之一,检测的准确率是百分之九十九,你测出阳性,真实的概率是多少?很多人会答百分之九十九,实际算下来只有百分之九左右。原因是健康人的基数太大,假阳性的数量远超真阳性。
这个反直觉的结果恰恰说明为什么要算而不是拍脑袋。贝叶斯思维的核心提醒是:任何单一证据都要放进“它本身有多常见”这个背景里去看。垃圾邮件过滤、风险预警、推荐排序,处处都有它的影子。
朴素贝叶斯分类器
把这个思想直接做成分类器,就是朴素贝叶斯。它计算“在属于某类的条件下,出现这些特征的概率”,再乘以该类的先验,取最大的那个类作为结果。朴素来自一个简化假设:假定各特征之间互不影响。
这个假设在现实中几乎不成立,但分类效果常常出人意料地好。它至今仍是文本分类的常用基线方法:计算量小、训练极快、对小数据友好,还能给出概率输出。实践中通常先拿它跑出一个基准分数,再判断复杂模型带来的那点提升是否值得。
常见问题
“朴素”的独立性假设这么不现实,为什么还有效?
因为分类任务往往只需要判断哪个类的相对可能性最大,而不必算出精确概率。即使各特征的真实概率被独立性假设估偏了,不同类别之间的排序仍可能保持正确。再加上它需要的训练数据少、不容易过拟合,小样本场景里尤其划算。
本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。