感知到底是什么?

如果你开过带辅助驾驶的车,你可能听过"感知"这个词。但感知到底在做什么?

用一个类比:感知就是给自动驾驶系统画一张"上帝视角的地图"。

自动驾驶感知系统全景流水线

想象你坐在驾驶位,你的眼睛在看什么?

  • 前面那辆车离我多远、开多快
  • 车道线在哪、是虚线还是实线
  • 路边有没有行人要过马路
  • 路面上有没有坑洼或障碍物

感知模块的任务,就是把摄像头、激光雷达、毫米波雷达的原始数据,变成结构化的场景描述——告诉规划模块"哪里能走、哪里不能走、周围的东西都在哪、它们要去哪"。

这篇文章会从传感器讲起,一路走到2026年最新的占用网络,把感知模块的每一层说清楚。


第一层:传感器——自动驾驶的"感官"

感知的起点是传感器。每类传感器各有优缺点,现代自动驾驶系统通常用多传感器融合来取长补短。

摄像头(Camera)

摄像头是信息最丰富的传感器。它提供纹理、颜色、语义信息——能看出"那是个红色车"、“那个标志是限速60”。但摄像头有一个根本缺陷:单目图像没有深度信息。一个像素可能对应近处的小物体,也可能对应远处的大物体。

典型配置:6-12 个摄像头环视部署,前向主摄像头可达 8MP 分辨率。Tesla 是纯视觉路线的代表,FSD HW4.0 用了 11 个摄像头。

激光雷达(LiDAR)

激光雷达直接测量 3D 点云——每个点都有精确的 (x, y, z) 坐标。它的优势是深度精确、不受光照影响,缺点是成本高、在雨雪天气性能下降。

2025-2026 年,激光雷达成本从 5000 美元降到约 2800 元人民币,让更多车型用上了 LiDAR。代表产品:禾赛 AT1440(1550nm,600m 探测)、速腾聚创 EM4(MEMS,499 美元)。

毫米波雷达(Radar)

毫米波雷达的优势在于直接测量速度(多普勒效应)和恶劣天气鲁棒。传统雷达分辨率低、无法识别物体形状。4D 成像雷达(2024-2026 年成熟)通过 MIMO 阵列提升到 0.1° 角分辨率,可以构建带高度信息的 4D 环境模型。

传感器融合

三种传感器互补:

条件摄像头LiDAR雷达
白天正常优秀优秀一般
夜间优秀良好
暴雨下降58%良好(下降12%)
浓雾极差下降83%良好(下降9%)

多传感器融合的核心挑战是时空对齐:把不同坐标系、不同频率的数据统一到同一个时空参考系。BEVFusion(NeurIPS 2022)是标志性工作,在 BEV 空间融合相机和 LiDAR 特征。


第二层:3D 目标检测——“有什么、在哪、多大”

感知最基础的任务是 3D 目标检测:从传感器数据中找出车辆、行人、骑行者等交通参与者,输出它们的 3D 边界框。

点云检测(LiDAR-only)

LiDAR 点云的处理方法经历了三代演进:

Voxel-based(体素法): VoxelNet(2018)把空间划分为 3D 体素网格,每个体素内用 PointNet 提取特征,然后用 3D 卷积处理。精度高但计算量巨大。SECOND(2018)引入稀疏卷积大幅加速。

Pillar-based(柱体法): PointPillars(2019)是工程实践的里程碑。它把点云在 xy 平面划分为 pillar(柱子),z 轴信息编码到特征通道中。核心洞察是"牺牲不太重要的 z 轴分辨率,换回 2D 卷积的效率"。PointPillars 在 KITTI 上达到 62Hz,比 VoxelNet 快 10 倍以上,至今仍是工程标配。

Point-based(点级法): PointRCNN、3DSSD 直接在原始点云上操作,精度最高但速度慢。后续的 PV-RCNN 系列尝试结合 point-based 和 voxel-based 的优点。

纯视觉检测(Camera-only)

纯视觉方案不做 LiDAR,从图像中推理 3D 信息。核心挑战是单目深度模糊——一个 2D 像素可以对应 3D 空间中一条射线上的任意点。

早期的 FCOS3D(2021)在 2D 检测器上加一个深度回归分支。DETR3D(2021)用 Transformer query 做端到端 3D 检测,摆脱了 NMS 后处理。PETR(2022)把 3D 坐标编码到位置 embedding 中。

纯视觉的核心优势是成本低,核心劣势是深度不准。2026 年,纯视觉+BEV+时序的方案已经可以接近 LiDAR 方案的表现。

多模态融合检测

融合相机和 LiDAR 是量产方案的主流。融合策略有三代:

  1. 结果级融合:各自检测,再 NMS 合并。简单但有信息损失。
  2. 点级融合:把图像特征投影到点云上做融合,如 F-PointNet、MV3D。
  3. BEV 级融合:在 BEV 空间融合两种模态特征,如 BEVFusion、TransFusion。这是当前最优方案——不同模态在同一个坐标系下互补。

检测输出

每个被检测到的目标输出一个结构化向量:

字段含义示例
ID目标唯一编号0, 1, 2, …
类别语义分类car, pedestrian, cyclist
x, y, z3D 中心位置(米)10.5, 2.3, 0.0
w, l, h3D 尺寸(米)1.8, 4.5, 1.5
yaw朝向角(弧度)0.52
vx, vy速度(m/s)5.0, 0.0
confidence置信度0.95

常用数据集和指标:KITTI(mAP)、nuScenes(NDS)、Waymo Open Dataset(mAP/mAPH)。


第三层:BEV 感知——统一鸟瞰图

传统方法在图像上做检测,再投影到 3D 空间。但多相机投影后的坐标可能不一致、融合困难。BEV(Bird’s Eye View)感知解决了这个问题——直接在统一的鸟瞰图坐标系中做感知。

LSS:开山之作

Lift-Splat-Shoot(ECCV 2020, NVIDIA)是 BEV 感知的奠基工作。它分三步:

  1. Lift(抬升): 对每张图像每个像素预测一个深度分布(不是单点深度),形成一个锥形点云(frustum)。
  2. Splat(溅射): 把所有相机的 frustum 点云根据内外参投影到 BEV 栅格,累积池化。
  3. Shoot(射击): 在 BEV cost map 上"射击"模板轨迹,选成本最低的执行。

LSS 的精妙之处在于:不要求精确深度,而是让模型自己学深度分布。模糊的物体均匀散布特征,清晰的物体集中在准确的深度上。

BEVFormer:Transformer 时代

BEVFormer(ECCV 2022)引入可学习的 BEV query。每个 BEV grid cell 有一个 query,通过 Cross-Attention 从多相机图像中聚合特征,再用 Temporal Self-Attention 融合历史帧的 BEV 特征。

BEVFormer 的核心优势:

  • 显式建模时序信息(对运动估计至关重要)
  • BEV query 解耦了图像分辨率和 BEV 分辨率
  • 单 BEV 特征支持多任务(检测、分割、地图构建)

后续的 BEVFormer v2、BEVDet、M2BEV 等改进了速度、稀疏化和多任务效果。

BEV 多任务输出

同一张 BEV 特征图可以接多个任务头:

  • 3D 目标检测头
  • 车道线/路网分割头(HDMapNet)
  • 可行驶区域分割头
  • 速度估计头

第四层:3D 占用网络——“不需要知道是什么,知道有东西就行”

Bounding Box 有一个根本缺陷:只能表示预定义类别的标准物体。掉落的树枝、施工锥桶、侧翻的卡车——这些都不符合"car"或"pedestrian"的典型形状,但都是危险障碍物。

占用网络(Occupancy Network)换了一种思路:不检测物体,检测空间。 它把周围空间划分为 3D 体素栅格,对每个体素预测"是否被占用"以及"被什么类型的物体占用"。

占用网络的演进

  • OccNet(ICCV 2023): 定义 3D 占用感知任务,发布 Occ3D 数据集
  • PanoOcc(CVPR 2024): 统一全景分割和占用预测
  • Cam4DOcc(CVPR 2024): 纯视觉 4D 占用预测(含时序)
  • UnO(CVPR 2024, Oral): 自监督占用场,无需 3D 标签
  • OccWorld(ECCV 2024): 占用世界模型,预测未来占用变化

BEV vs 占用

维度BEV占用网络
空间维度2D (x, y)3D (x, y, z)
高度信息丢失保留
非标准物体无法描述可描述
算力需求
2026 趋势逐渐被占用取代成为感知新范式

InfoFusion 2025 年综述指出:“3D 占用感知正在成为自动驾驶感知系统的新趋势,捕获了 BEV 忽略的垂直结构。”


第五层:语义分割 + 车道线检测

除了检测物体,感知还要理解道路结构

可行驶区域分割

把图像或 BEV 中的每个像素/格子分为"能走/不能走"。这是规划器最重要的输入之一——规划器只在 free space 内生成轨迹。

代表工作:SegFormer(2021,层级 Transformer 编码)、PIDNet(2023,实时语义分割)。

车道线检测

检测车道线的位置、类型(虚线/实线/双线/黄色/白色)、曲率。输出给预测模块做意图推理——“这辆车在车道线内,但它在虚线区域打了转向灯,可能要变道”。

代表工作:LaneNet(2018,实例分割式车道检测)、UFLD(2020,超快速车道检测)。

2025-2026 年趋势:用 transformer 或 CNN 直接从 BEV 做端到端车道线检测,规避图像投影的误差。


第六层:多目标跟踪 + 状态估计

单帧检测只能告诉你"现在有什么",但规划需要知道"这辆车过去 3 秒在怎么运动"。

Tracking-by-Detection

最常见的范式中,检测器每帧输出检测框,跟踪器把相邻帧的框关联起来:

  1. 用 Kalman Filter 预测每个轨迹在当前帧的位置
  2. 用 IoU 或 ReID 特征匹配检测和轨迹
  3. 用匈牙利算法做最优分配

代表工作:SORT(2016,纯运动模型+IoU匹配,260Hz)、DeepSORT(2017,+ReID外观特征)、ByteTrack(2022,高低分框分治)。

状态估计

跟踪给每个目标分配稳定 ID 后,可以做更精确的运动估计:

  • Kalman Filter 平滑速度估计
  • 交互模型预测意图(变道/直行/转弯)
  • 未来轨迹预测(MultiPath++、Wayformer)

这些信息输入到行为预测模块,规划器据此生成安全轨迹。


感知的输出:传给下游的是什么?

经过以上六层处理后,感知模块的输出可以概括为:

输出项格式说明
3D 目标列表[{ID, class, x, y, z, w, l, h, yaw, vx, vy, conf}] x N 个目标每个交通参与者的完整状态
可行驶区域BEV grid {free, occupied} x H x W告诉规划器哪里能走
车道线结构[{line_type, curve_params}] x M 条车道车道拓扑和线型
3D 占用occupancy_grid x X x Y x Z体素级占用和语义
跟踪轨迹[{ID, history, velocity, intent}] x N带 ID 的稳定轨迹

这些结构化的数据传给预测模块做交互推理,再传给规划模块做轨迹生成。


关键论文速览

检测与感知

  • PointPillars (CVPR 2019) — 奠基性的 pillar 式点云检测,62Hz
  • VoxelNet (CVPR 2018) — 端到端体素检测
  • SECOND (2018) — 稀疏卷积加速体素检测
  • LSS (ECCV 2020) — BEV 感知开山之作,深度分布隐式建模
  • BEVFormer (ECCV 2022) — Transformer-based BEV,显式时序建模
  • DETR3D (CoRL 2021) — 端到端 3D 检测,不依赖 NMS
  • BEVFusion (NeurIPS 2022) — 多模态 BEV 级融合

占用网络

  • OccNet (ICCV 2023) — 定义 3D 占用感知任务
  • PanoOcc (CVPR 2024) — 统一全景分割和占用
  • Cam4DOcc (CVPR 2024) — 纯视觉 4D 占用预测
  • OccWorld (ECCV 2024) — 占用世界模型
  • UnO (CVPR 2024 Oral) — 自监督占用场

分割与跟踪

  • SegFormer (NeurIPS 2021) — 层级 Transformer 分割
  • PIDNet (CVPR 2023) — 实时语义分割
  • SORT / DeepSORT (2016/2017) — Tracking-by-detection 经典
  • ByteTrack (ECCV 2022) — 高低分框分治跟踪

综述

  • 3D Object Detection Survey (IEEE T-ITS 2019) — 最早的系统性 3D 检测综述
  • BEV Perception Survey (IEEE T-PAMI 2023) — BEV 感知全景
  • Occupancy Perception Survey (InfoFusion 2025) — 3D 占用感知综述
  • 复杂场景感知综述 (中国公路学报 2026) — 高阶自动驾驶感知关键技术

感知技术的演进脉络

时期主流范式代表工作
2017-20192D检测+后处理VoxelNet, PointPillars, SECOND, Frustum PointNet
2020-2022BEV感知兴起LSS, BEVFormer, BEVFusion, DETR3D, PETR
2023-2024占用网络崛起OccNet, PanoOcc, Cam4DOcc, OccWorld, UnO
2025-2026感知统一化SparseOccVLA, OccVLA, HENet++, UniSparseBEV

每条技术路线不是替代关系,而是适用于不同的工业化阶段和成本约束。PointPillars 到今天仍然是最好的工程选择之一,BEV 是 2022-2025 的主流,占用是 2024 开始兴起的新范式。


最后

感知不是自动驾驶的全部——它只是第一环。但如果你不理解感知输出了什么,你就无法理解预测和规划为什么那样工作。

核心记住一句话:感知的目标不是"看得全",而是"看得懂"。把物理世界的原始传感器数据,翻译成规划器能直接使用的结构化场景描述。


📖 本文基于对自动驾驶感知领域 30+ 篇论文和 10+ 份技术综述的调研。