感知到底是什么?
如果你开过带辅助驾驶的车,你可能听过"感知"这个词。但感知到底在做什么?
用一个类比:感知就是给自动驾驶系统画一张"上帝视角的地图"。
想象你坐在驾驶位,你的眼睛在看什么?
- 前面那辆车离我多远、开多快
- 车道线在哪、是虚线还是实线
- 路边有没有行人要过马路
- 路面上有没有坑洼或障碍物
感知模块的任务,就是把摄像头、激光雷达、毫米波雷达的原始数据,变成结构化的场景描述——告诉规划模块"哪里能走、哪里不能走、周围的东西都在哪、它们要去哪"。
这篇文章会从传感器讲起,一路走到2026年最新的占用网络,把感知模块的每一层说清楚。
第一层:传感器——自动驾驶的"感官"
感知的起点是传感器。每类传感器各有优缺点,现代自动驾驶系统通常用多传感器融合来取长补短。
摄像头(Camera)
摄像头是信息最丰富的传感器。它提供纹理、颜色、语义信息——能看出"那是个红色车"、“那个标志是限速60”。但摄像头有一个根本缺陷:单目图像没有深度信息。一个像素可能对应近处的小物体,也可能对应远处的大物体。
典型配置:6-12 个摄像头环视部署,前向主摄像头可达 8MP 分辨率。Tesla 是纯视觉路线的代表,FSD HW4.0 用了 11 个摄像头。
激光雷达(LiDAR)
激光雷达直接测量 3D 点云——每个点都有精确的 (x, y, z) 坐标。它的优势是深度精确、不受光照影响,缺点是成本高、在雨雪天气性能下降。
2025-2026 年,激光雷达成本从 5000 美元降到约 2800 元人民币,让更多车型用上了 LiDAR。代表产品:禾赛 AT1440(1550nm,600m 探测)、速腾聚创 EM4(MEMS,499 美元)。
毫米波雷达(Radar)
毫米波雷达的优势在于直接测量速度(多普勒效应)和恶劣天气鲁棒。传统雷达分辨率低、无法识别物体形状。4D 成像雷达(2024-2026 年成熟)通过 MIMO 阵列提升到 0.1° 角分辨率,可以构建带高度信息的 4D 环境模型。
传感器融合
三种传感器互补:
| 条件 | 摄像头 | LiDAR | 雷达 |
|---|---|---|---|
| 白天正常 | 优秀 | 优秀 | 一般 |
| 夜间 | 差 | 优秀 | 良好 |
| 暴雨 | 差 | 下降58% | 良好(下降12%) |
| 浓雾 | 极差 | 下降83% | 良好(下降9%) |
多传感器融合的核心挑战是时空对齐:把不同坐标系、不同频率的数据统一到同一个时空参考系。BEVFusion(NeurIPS 2022)是标志性工作,在 BEV 空间融合相机和 LiDAR 特征。
第二层:3D 目标检测——“有什么、在哪、多大”
感知最基础的任务是 3D 目标检测:从传感器数据中找出车辆、行人、骑行者等交通参与者,输出它们的 3D 边界框。
点云检测(LiDAR-only)
LiDAR 点云的处理方法经历了三代演进:
Voxel-based(体素法): VoxelNet(2018)把空间划分为 3D 体素网格,每个体素内用 PointNet 提取特征,然后用 3D 卷积处理。精度高但计算量巨大。SECOND(2018)引入稀疏卷积大幅加速。
Pillar-based(柱体法): PointPillars(2019)是工程实践的里程碑。它把点云在 xy 平面划分为 pillar(柱子),z 轴信息编码到特征通道中。核心洞察是"牺牲不太重要的 z 轴分辨率,换回 2D 卷积的效率"。PointPillars 在 KITTI 上达到 62Hz,比 VoxelNet 快 10 倍以上,至今仍是工程标配。
Point-based(点级法): PointRCNN、3DSSD 直接在原始点云上操作,精度最高但速度慢。后续的 PV-RCNN 系列尝试结合 point-based 和 voxel-based 的优点。
纯视觉检测(Camera-only)
纯视觉方案不做 LiDAR,从图像中推理 3D 信息。核心挑战是单目深度模糊——一个 2D 像素可以对应 3D 空间中一条射线上的任意点。
早期的 FCOS3D(2021)在 2D 检测器上加一个深度回归分支。DETR3D(2021)用 Transformer query 做端到端 3D 检测,摆脱了 NMS 后处理。PETR(2022)把 3D 坐标编码到位置 embedding 中。
纯视觉的核心优势是成本低,核心劣势是深度不准。2026 年,纯视觉+BEV+时序的方案已经可以接近 LiDAR 方案的表现。
多模态融合检测
融合相机和 LiDAR 是量产方案的主流。融合策略有三代:
- 结果级融合:各自检测,再 NMS 合并。简单但有信息损失。
- 点级融合:把图像特征投影到点云上做融合,如 F-PointNet、MV3D。
- BEV 级融合:在 BEV 空间融合两种模态特征,如 BEVFusion、TransFusion。这是当前最优方案——不同模态在同一个坐标系下互补。
检测输出
每个被检测到的目标输出一个结构化向量:
| 字段 | 含义 | 示例 |
|---|---|---|
| ID | 目标唯一编号 | 0, 1, 2, … |
| 类别 | 语义分类 | car, pedestrian, cyclist |
| x, y, z | 3D 中心位置(米) | 10.5, 2.3, 0.0 |
| w, l, h | 3D 尺寸(米) | 1.8, 4.5, 1.5 |
| yaw | 朝向角(弧度) | 0.52 |
| vx, vy | 速度(m/s) | 5.0, 0.0 |
| confidence | 置信度 | 0.95 |
常用数据集和指标:KITTI(mAP)、nuScenes(NDS)、Waymo Open Dataset(mAP/mAPH)。
第三层:BEV 感知——统一鸟瞰图
传统方法在图像上做检测,再投影到 3D 空间。但多相机投影后的坐标可能不一致、融合困难。BEV(Bird’s Eye View)感知解决了这个问题——直接在统一的鸟瞰图坐标系中做感知。
LSS:开山之作
Lift-Splat-Shoot(ECCV 2020, NVIDIA)是 BEV 感知的奠基工作。它分三步:
- Lift(抬升): 对每张图像每个像素预测一个深度分布(不是单点深度),形成一个锥形点云(frustum)。
- Splat(溅射): 把所有相机的 frustum 点云根据内外参投影到 BEV 栅格,累积池化。
- Shoot(射击): 在 BEV cost map 上"射击"模板轨迹,选成本最低的执行。
LSS 的精妙之处在于:不要求精确深度,而是让模型自己学深度分布。模糊的物体均匀散布特征,清晰的物体集中在准确的深度上。
BEVFormer:Transformer 时代
BEVFormer(ECCV 2022)引入可学习的 BEV query。每个 BEV grid cell 有一个 query,通过 Cross-Attention 从多相机图像中聚合特征,再用 Temporal Self-Attention 融合历史帧的 BEV 特征。
BEVFormer 的核心优势:
- 显式建模时序信息(对运动估计至关重要)
- BEV query 解耦了图像分辨率和 BEV 分辨率
- 单 BEV 特征支持多任务(检测、分割、地图构建)
后续的 BEVFormer v2、BEVDet、M2BEV 等改进了速度、稀疏化和多任务效果。
BEV 多任务输出
同一张 BEV 特征图可以接多个任务头:
- 3D 目标检测头
- 车道线/路网分割头(HDMapNet)
- 可行驶区域分割头
- 速度估计头
第四层:3D 占用网络——“不需要知道是什么,知道有东西就行”
Bounding Box 有一个根本缺陷:只能表示预定义类别的标准物体。掉落的树枝、施工锥桶、侧翻的卡车——这些都不符合"car"或"pedestrian"的典型形状,但都是危险障碍物。
占用网络(Occupancy Network)换了一种思路:不检测物体,检测空间。 它把周围空间划分为 3D 体素栅格,对每个体素预测"是否被占用"以及"被什么类型的物体占用"。
占用网络的演进
- OccNet(ICCV 2023): 定义 3D 占用感知任务,发布 Occ3D 数据集
- PanoOcc(CVPR 2024): 统一全景分割和占用预测
- Cam4DOcc(CVPR 2024): 纯视觉 4D 占用预测(含时序)
- UnO(CVPR 2024, Oral): 自监督占用场,无需 3D 标签
- OccWorld(ECCV 2024): 占用世界模型,预测未来占用变化
BEV vs 占用
| 维度 | BEV | 占用网络 |
|---|---|---|
| 空间维度 | 2D (x, y) | 3D (x, y, z) |
| 高度信息 | 丢失 | 保留 |
| 非标准物体 | 无法描述 | 可描述 |
| 算力需求 | 低 | 高 |
| 2026 趋势 | 逐渐被占用取代 | 成为感知新范式 |
InfoFusion 2025 年综述指出:“3D 占用感知正在成为自动驾驶感知系统的新趋势,捕获了 BEV 忽略的垂直结构。”
第五层:语义分割 + 车道线检测
除了检测物体,感知还要理解道路结构。
可行驶区域分割
把图像或 BEV 中的每个像素/格子分为"能走/不能走"。这是规划器最重要的输入之一——规划器只在 free space 内生成轨迹。
代表工作:SegFormer(2021,层级 Transformer 编码)、PIDNet(2023,实时语义分割)。
车道线检测
检测车道线的位置、类型(虚线/实线/双线/黄色/白色)、曲率。输出给预测模块做意图推理——“这辆车在车道线内,但它在虚线区域打了转向灯,可能要变道”。
代表工作:LaneNet(2018,实例分割式车道检测)、UFLD(2020,超快速车道检测)。
2025-2026 年趋势:用 transformer 或 CNN 直接从 BEV 做端到端车道线检测,规避图像投影的误差。
第六层:多目标跟踪 + 状态估计
单帧检测只能告诉你"现在有什么",但规划需要知道"这辆车过去 3 秒在怎么运动"。
Tracking-by-Detection
最常见的范式中,检测器每帧输出检测框,跟踪器把相邻帧的框关联起来:
- 用 Kalman Filter 预测每个轨迹在当前帧的位置
- 用 IoU 或 ReID 特征匹配检测和轨迹
- 用匈牙利算法做最优分配
代表工作:SORT(2016,纯运动模型+IoU匹配,260Hz)、DeepSORT(2017,+ReID外观特征)、ByteTrack(2022,高低分框分治)。
状态估计
跟踪给每个目标分配稳定 ID 后,可以做更精确的运动估计:
- Kalman Filter 平滑速度估计
- 交互模型预测意图(变道/直行/转弯)
- 未来轨迹预测(MultiPath++、Wayformer)
这些信息输入到行为预测模块,规划器据此生成安全轨迹。
感知的输出:传给下游的是什么?
经过以上六层处理后,感知模块的输出可以概括为:
| 输出项 | 格式 | 说明 |
|---|---|---|
| 3D 目标列表 | [{ID, class, x, y, z, w, l, h, yaw, vx, vy, conf}] x N 个目标 | 每个交通参与者的完整状态 |
| 可行驶区域 | BEV grid {free, occupied} x H x W | 告诉规划器哪里能走 |
| 车道线结构 | [{line_type, curve_params}] x M 条车道 | 车道拓扑和线型 |
| 3D 占用 | occupancy_grid x X x Y x Z | 体素级占用和语义 |
| 跟踪轨迹 | [{ID, history, velocity, intent}] x N | 带 ID 的稳定轨迹 |
这些结构化的数据传给预测模块做交互推理,再传给规划模块做轨迹生成。
关键论文速览
检测与感知
- PointPillars (CVPR 2019) — 奠基性的 pillar 式点云检测,62Hz
- VoxelNet (CVPR 2018) — 端到端体素检测
- SECOND (2018) — 稀疏卷积加速体素检测
- LSS (ECCV 2020) — BEV 感知开山之作,深度分布隐式建模
- BEVFormer (ECCV 2022) — Transformer-based BEV,显式时序建模
- DETR3D (CoRL 2021) — 端到端 3D 检测,不依赖 NMS
- BEVFusion (NeurIPS 2022) — 多模态 BEV 级融合
占用网络
- OccNet (ICCV 2023) — 定义 3D 占用感知任务
- PanoOcc (CVPR 2024) — 统一全景分割和占用
- Cam4DOcc (CVPR 2024) — 纯视觉 4D 占用预测
- OccWorld (ECCV 2024) — 占用世界模型
- UnO (CVPR 2024 Oral) — 自监督占用场
分割与跟踪
- SegFormer (NeurIPS 2021) — 层级 Transformer 分割
- PIDNet (CVPR 2023) — 实时语义分割
- SORT / DeepSORT (2016/2017) — Tracking-by-detection 经典
- ByteTrack (ECCV 2022) — 高低分框分治跟踪
综述
- 3D Object Detection Survey (IEEE T-ITS 2019) — 最早的系统性 3D 检测综述
- BEV Perception Survey (IEEE T-PAMI 2023) — BEV 感知全景
- Occupancy Perception Survey (InfoFusion 2025) — 3D 占用感知综述
- 复杂场景感知综述 (中国公路学报 2026) — 高阶自动驾驶感知关键技术
感知技术的演进脉络
| 时期 | 主流范式 | 代表工作 |
|---|---|---|
| 2017-2019 | 2D检测+后处理 | VoxelNet, PointPillars, SECOND, Frustum PointNet |
| 2020-2022 | BEV感知兴起 | LSS, BEVFormer, BEVFusion, DETR3D, PETR |
| 2023-2024 | 占用网络崛起 | OccNet, PanoOcc, Cam4DOcc, OccWorld, UnO |
| 2025-2026 | 感知统一化 | SparseOccVLA, OccVLA, HENet++, UniSparseBEV |
每条技术路线不是替代关系,而是适用于不同的工业化阶段和成本约束。PointPillars 到今天仍然是最好的工程选择之一,BEV 是 2022-2025 的主流,占用是 2024 开始兴起的新范式。
最后
感知不是自动驾驶的全部——它只是第一环。但如果你不理解感知输出了什么,你就无法理解预测和规划为什么那样工作。
核心记住一句话:感知的目标不是"看得全",而是"看得懂"。把物理世界的原始传感器数据,翻译成规划器能直接使用的结构化场景描述。
📖 本文基于对自动驾驶感知领域 30+ 篇论文和 10+ 份技术综述的调研。