让计算机看懂照片,是深度学习最早取得的重大突破之一。卷积神经网络用一块块小窗口在图像上滑动,先找边缘、再拼形状、最后识别物体。本文讲清卷积、池化与层级特征的直观含义,以及它的转折点。
核心要点
- 卷积用可复用的小窗口扫描整张图,大幅减少需要学习的参数量。
- 浅层学会边缘和色块,深层逐步拼出眼睛、轮廓这类语义特征。
- 池化层压缩分辨率,让特征的位置轻微偏移不影响最终判断。
用小窗口扫描图像
如果让全连接网络处理一张照片,每个像素都要连到下一层的每个神经元,参数数量会大到难以承受。卷积网络换了个思路:不再全局连接,而是用一个小小的窗口在图像上滑动,每停一处就做一次加权求和,得到一个新数值。整张图扫完,就得到一张新的特征图。
关键在于,这个窗口的参数是共享的。无论它滑到左上角还是右下角,用的都是同一组权重。这意味着网络学到的是某种样子,而不是某个位置有某种样子——目标出现在画面左边还是右边,都能被同样的窗口捕捉到。参数量因此被压缩了几个数量级。
从边缘到语义的层级
把许多窗口叠在一起,第一层可能各自对横线、竖线、斜边或某种色块有反应。再往上一层,这些简单反应被组合成拐角、圆弧、纹理;继续往上,逐渐出现对眼睛、车轮、笔画这类有语义结构的响应。层次越深,视野越大,抽象程度也越高。
这种层层递进很像视觉系统的处理方式:先有局部细节,再拼出整体。正因为如此,训练好的卷积网络中间层常常可以直接拿来用——把分类网络的前面几层接在新任务上,往往就能得到不错的通用特征提取器,这也是迁移学习在视觉领域格外流行的原因。
2012 年的转折点
卷积网络的思想由来已久,1998 年前后就有用于手写数字识别的经典网络问世,但受限于数据与算力,长期没能成为主流。2012 年,一个深度卷积网络在大规模图像识别比赛上大幅领先,此后它迅速成为视觉任务的标准配置,也重新点燃了整个领域的热情。
除了图像,卷积的思路还被搬到很多地方。只要数据具有局部结构和平移不变性——相邻的片段关系密切、模式出现在哪都算数——卷积就有用武之地,比如一段音频、一条时间序列,甚至一句话中的相邻词组。差别只在于窗口是在一维上滑,还是在平面上滑。
常见问题
为什么现在有些视觉模型不用卷积了?
因为注意力类结构被证明在数据量足够大时能力更强,它们不预设局部性,能直接建模任意两个位置的关系。卷积的先验在小数据上是优势,在海量数据上反而成了限制。不过卷积效率高、易部署,在移动端和实时场景仍是主流选择。
本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。