机器不能直接看见一张照片或一段文字,它只处理数字。特征工程就是把原始素材转换成对任务有用的数字描述的过程。本文用相亲简历和挑选食材的类比,讲清特征构造、选择与变换三类操作,以及深度学习如何改变了这项工作。
核心要点
- 特征是对原始数据的数字化描述,决定模型能看到什么
- 好的特征让简单模型也能取得相当不错的效果
- 深度学习把人工设计特征换成了自动学习特征
从像素到“有胡须”
人看一张猫的照片,一眼就认出是猫;机器看到的却是一个数字矩阵,每个格子记录一个像素的亮度。要让机器学会分辨,就得先把原始素材转化成有意义的描述:有没有胡须状的边缘、耳朵是尖的还是圆的、毛色如何分布。这些描述就是特征。
类比相亲:整页自我介绍是原始数据,而年龄、身高、学历、常住城市是特征。你怎么提炼这些字段,直接决定了后面的匹配算法能有多准。特征工程做的就是这份把杂乱信息整理成结构化字段的活儿。
三类常见操作
特征工程有三类常见操作。一是构造,把已有字段组合出新的量,比如用总价除以面积得到单价;二是选择,删掉与目标无关或互相重复的字段,减少噪声和计算量;三是变换,把取值范围差异巨大的字段缩放到可比区间,或者把类别文字转成数字编码。
为什么要变换?想象两个特征,一个取值在零到一之间,另一个在零到一百万之间。很多算法按距离判断相似性,后者会完全压倒前者,模型相当于只在看一个字段。缩放之后,两个特征才有平等的发言权。
深度学习改变了什么
好特征的价值常被低估。在不少实际项目里,一位熟悉业务的工程师手工构造出的几个关键特征,就能让一个简单的线性模型达到相当不错的效果;而复杂模型配上糟糕的特征,反而更差。
深度学习的流行改变了这件事。多层网络能从原始像素、原始文字中自动逐层提取特征,省去了大量人工设计,这也是它在图像、语音、文本上表现突出的原因。但这不等于特征工程消失了:在表格数据和小样本场景里,人工特征依然是核心竞争力。
常见问题
有了深度学习,还需要学特征工程吗?
需要。深度学习主要接管了图像、语音、文本等非结构化数据的特征提取,但业务表格、风控、推荐等场景依然高度依赖人工特征。而且即便用深度学习,如何把业务问题定义成合适的输入输出、如何做数据增强,本质上仍是特征思维。
本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。