BEV 感知技术详解:自动驾驶的鸟瞰图视角

BEV 感知将多摄像头画面统一重投影到以自车为中心的鸟瞰图空间,解决了透视图像到度量空间的根本矛盾。本文详细讲解 LSS 与 Transformer 两条主流视角变换路线,以及 BEVFormer 等代表方法的架构设计。BEV 已是现代端到端自动驾驶感知系统的事实标准中间表示。

2026年7月18日 · 3 分钟 · 607 字 · 

论文精读|Sparse4D:全稀疏多摄像头 3D 感知的三连击

Sparse4D 用全稀疏范式挑战 BEV 感知路线:用稀疏实例 query 直接从多相机图像抠出 3D 目标,绕开计算昂贵的稠密 BEV 特征图。它通过稀疏 4D 关键点采样、循环时序融合和实例去噪三项核心设计,将多摄像头 3D 检测与跟踪做到 nuScenes 顶尖。作为全稀疏感知范式奠基作,后续 SparseDrive 系列在此基础上构建端到端驾驶系统。

2026年7月19日 · 4 分钟 · 844 字 · 

论文精读|BEVFormer:时空 Transformer 玩转多摄像头 BEV 感知

BEVFormer 开创了基于可学习 BEV queries 的时空 Transformer 感知范式,用空间交叉注意力从多视图图像采样特征、用时间自注意力沿时序聚合信息。它纯靠多摄像头就在 nuScenes 上达到 56.9% NDS 逼近 LiDAR 基线。此后几乎所有端到端驾驶方案都沿用其 BEV query+时序融合的基本设计。

2026年7月19日 · 3 分钟 · 498 字 ·