面对同一张街景照片,计算机视觉能回答三种不同精度的问题。本文用一张照片串起图像分类、目标检测与图像分割三类任务:输出从一句话到一组框,再到逐像素的涂色图,难度与用途各不相同。
核心要点
- 图像分类给整张图一个标签,适合主体明确的场景
- 目标检测要同时给出类别与包围框,处理数量未知的多个目标
- 图像分割把标签细化到每个像素,实例分割还能区分个体
同一张照片,三种不同问法
面对同一张街景照片,你可以问三种问题。第一种是“这张图里主要是什么”,答案是“街道”;第二种是“有哪些东西、分别在什么位置”,答案是“左边一辆车,右边两个行人”;第三种最细致,要求把每个像素归到某个物体上,连车轮与地面的分界也要勾清。
这三种问法对应视觉最基本的三类任务:图像分类(image classification)、目标检测(object detection)与图像分割(image segmentation)。它们的难度依次递增,答案也从一句话变成一组框,再变成一张涂满颜色的图。
图像分类:给整张图一个答案
图像分类最简单:输入一张图,输出一个类别标签,通常还附带置信度。它假定画面中有一个主体,适合相册自动归类、工业零件合格判断等场景,只需判断“像不像”,不必理解空间位置。
典型做法是先由卷积网络提取整图特征,再交给分类器打分。由于它关注全局统计,当目标只占画面一角时,模型容易被大面积背景干扰。这也是复杂场景不能只靠分类解决的原因。
目标检测:既要知道是什么,也要知道在哪
目标检测更进一步:除类别外,还要用包围框(bounding box)标出位置。一张图里可能有任意多个目标,数量未知、大小不一、彼此遮挡,因此模型需要在大量候选区域上逐一判断,并剔除重复框。
检测器通常把任务拆成两步:先找出可能存在物体的区域,再判定类别并微调框的位置。行人检测、车辆检测、缺陷定位都属此类,自动驾驶与安防监控高度依赖它。评价时常看框的位置准不准、类别对不对等综合指标。
图像分割:把答案细化到每一个像素
分割把精度推到极致:为每个像素分配标签。语义分割只区分类别,把所有属于“道路”的像素涂成同色,不区分个体;实例分割则进一步区分个体,能把画面里三个人分别标成不同颜色。它适合需要精细边界的场景,如医学影像勾画病灶范围、卫星图统计耕地面积、视频会议的背景虚化。
常见问题
三类任务该选哪一个?
看你要多精细。只需判断画面主体是什么,用分类;还要知道有几个目标、在什么位置,用检测;需要精确轮廓,比如量面积或做背景替换,才用分割。分割的代价是标注成本极高,训练数据往往需要人工逐像素描边。
本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。