论文精读|UniAD:面向规划的端到端自动驾驶框架(CVPR 2023最佳论文)
UniAD 首次将感知、预测、规划全部统一进一个可端到端联合训练的网络,以规划为最终目标反向驱动所有中间任务。它开创了显式端到端新范式,每个模块输出可解释的中间表示,并通过规划导向的联合优化全面提升系统一致性。获 CVPR 2023 最佳论文奖,是自动驾驶端到端路线里程碑式的奠基工作。
UniAD 首次将感知、预测、规划全部统一进一个可端到端联合训练的网络,以规划为最终目标反向驱动所有中间任务。它开创了显式端到端新范式,每个模块输出可解释的中间表示,并通过规划导向的联合优化全面提升系统一致性。获 CVPR 2023 最佳论文奖,是自动驾驶端到端路线里程碑式的奠基工作。
端到端自动驾驶将传感器输入直接映射到控制输出,消除了模块化方案中的误差累积与信息瓶颈问题。本文梳理从隐式端到端到显式端到端再到生成式大模型的三代架构演进,对比 UniAD、VAD、VLA 等代表性方案。为理解这一技术路线提供了完整的历史脉络与趋势展望。
BEV 感知将多摄像头画面统一重投影到以自车为中心的鸟瞰图空间,解决了透视图像到度量空间的根本矛盾。本文详细讲解 LSS 与 Transformer 两条主流视角变换路线,以及 BEVFormer 等代表方法的架构设计。BEV 已是现代端到端自动驾驶感知系统的事实标准中间表示。
3D 坐标系统是自动驾驶感知的数学基石。本文详解六大坐标系(世界、自车、相机、LiDAR、BEV、图像像素)的定义与变换关系,覆盖针孔投影、内外参标定、3D↔2D 投影流程,以及 BEVFormer 等模型中的坐标变换设计。理解坐标系统就等于理解了感知流水线的数学骨架。
Percept-WAM 回答的是 WAM 系列的另一个致命问题:VLM 的空间感太差——‘定位漂移、时序不一致、置信度虚高’,导致 VLA 系统的感知和规划都不稳。它把 2D/3D 感知任务直接’种’进单个 VLM 里:用 World-PV token(透视视角)和 World-BEV token(鸟瞰视角)编码可定位的世界状态,配合网格条件化预测头、IoU 校准置信度和并行自回归解码,再用四组点级 query(Q_pv/Q_bev/Q_ego/Q_full)把感知表示对齐成轨迹。NAVSIM v1 拿到 90.2 PDMS,超过 DiffusionDrive 2.1,还配了流式推理把时延压到 707ms。
在线高精地图构建是自动驾驶感知的核心模块之一,它从传感器数据中实时重建车道线、边界、路口等道路元素。本文详解 HDMapNet、MapTR、VectorMapNet 等代表性方案的技术路线,覆盖分割→向量化、端到端 Transformer 解析、车道图构建,以及地图在规划中的约束作用。
JEPA 是 Yann LeCun 提出的自监督表征学习框架,核心思想是在嵌入空间做预测而非重建像素,避免了对决策无关细节的浪费。它采用双编码器加预测器的架构,配合 EMA 目标编码器与 stop-gradient 机制实现稳定训练。在自动驾驶世界模型中已成为生成式方法的重要替代方案。
VAD 将整个驾驶场景建模为全向量化表示——地图元素和 agent 运动都变成矢量,彻底抛弃了 UniAD 中的稠密栅格。它通过隐式 query 交互和显式三个向量化规划约束,在保持精度的同时将推理速度提升 2.5-9.3 倍。作为 UniAD 之后最重要的效率改进工作,VAD 为端到端驾驶的实时部署铺平了道路。
Occupancy 网络通过稠密的 3D 体素网格表示场景,突破了 3D 目标检测对“物体”范畴的限制,可表征任意形状的障碍物与自由空间。本文详解其与检测的差异、OccFormer/FlashOcc/OpenOccupancy 等代表架构,以及在 NIFF 等世界模型中 occupancy 如何作为核心场景表示驱动未来预测与规划决策。
自动驾驶依赖多传感器融合来克服单一传感器在弱光、雨雪等场景下的能力边界。本文系统对比摄像头、激光雷达、毫米波雷达等主流传感器的原理与优劣,深入讲解时空同步与多模态融合策略。最后阐述 BEV 作为统一表示空间如何串联感知全链路。
Sparse4D 用全稀疏范式挑战 BEV 感知路线:用稀疏实例 query 直接从多相机图像抠出 3D 目标,绕开计算昂贵的稠密 BEV 特征图。它通过稀疏 4D 关键点采样、循环时序融合和实例去噪三项核心设计,将多摄像头 3D 检测与跟踪做到 nuScenes 顶尖。作为全稀疏感知范式奠基作,后续 SparseDrive 系列在此基础上构建端到端驾驶系统。
BEVFormer 开创了基于可学习 BEV queries 的时空 Transformer 感知范式,用空间交叉注意力从多视图图像采样特征、用时间自注意力沿时序聚合信息。它纯靠多摄像头就在 nuScenes 上达到 56.9% NDS 逼近 LiDAR 基线。此后几乎所有端到端驾驶方案都沿用其 BEV query+时序融合的基本设计。