自动驾驶被拆成感知、预测、决策规划三级阶梯,每秒运转数十次。本文讲清摄像头、毫米波雷达与激光雷达如何互补,鸟瞰图表示有什么用,以及为什么量产车大多是仍需人类监督的驾驶辅助。
核心要点
- 感知融合三类传感器,输出结构化的障碍物状态而非图片
- 预测给出多条未来轨迹及概率,而非单一答案
- 量产系统多以规则与优化为主,学习模块负责感知等子任务
三级阶梯
自动驾驶系统通常被拆成三个环节:感知回答周围有什么,预测回答它们接下来会做什么,决策规划回答我该怎么走。执行层再把轨迹转成方向盘、油门与刹车的指令。这条链路每秒要运转数十次。
需要说明的是,市面上量产车提供的大多是驾驶辅助功能,属于国际自动机工程师学会(SAE)分级中的 L2 级别,驾驶员仍需随时接管。真正无需监督的 L4、L5 系统,主要在限定区域的示范运营中测试。
感知:多传感器融合
摄像头提供丰富的纹理与颜色,能识别红绿灯与文字;毫米波雷达直接测速,穿透雨雾能力强;激光雷达(LiDAR)给出精确的三维点云。三类传感器各有短板,融合的目标是取长补短,并在某个传感器失效时保持可用。
感知的输出不是一张图,而是结构化信息:每个障碍物在哪里、朝向如何、速度多少、属于车辆还是行人。近年流行的鸟瞰图(BEV)表示,就是把多视角图像统一投射到俯视坐标系,方便后续规划直接使用。
预测:猜测他人的意图
交通是多人博弈。一辆车打着转向灯靠边,可能是要停车,也可能只是犹豫;一个行人站在路边看手机,可能下一步就迈上斑马线。预测模块通常给出多条可能的未来轨迹及各自概率,而不是单一答案。
难点在于交互性:你的动作会影响别人,别人的动作也影响你。过于保守会让车辆寸步难行,过于激进则带来风险。如何在不确定中做出稳健决策,是这一层最核心的课题。
决策与规划的取舍
规划要在安全、舒适、效率与交规之间权衡。基于规则的方法可解释、易调试;基于学习的方法更灵活,能模仿人类驾驶风格。当前量产系统大多以规则与优化为主,学习模块负责感知与部分子任务。
争议主要集中在责任归属与能力边界的沟通上:系统能做什么、不能做什么,驾驶员是否理解,比单纯堆砌演示里程更重要。行业也在推动更清晰的功能命名与安全标准。
常见问题
自动驾驶会像人类一样“学习”开车吗?
部分环节会,但主干仍是工程化的规则与优化。感知大量使用深度学习,驾驶策略则更多依赖可解释、可验证的规划算法,因为出错时需要追溯原因。把学习引入核心决策,安全性论证与责任划分都更加困难。
本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。