BEV 感知技术详解:自动驾驶的鸟瞰图视角

BEV 感知将多摄像头画面统一重投影到以自车为中心的鸟瞰图空间,解决了透视图像到度量空间的根本矛盾。本文详细讲解 LSS 与 Transformer 两条主流视角变换路线,以及 BEVFormer 等代表方法的架构设计。BEV 已是现代端到端自动驾驶感知系统的事实标准中间表示。

2026年7月18日 · 3 分钟 · 607 字 · 

论文精读|BEVFormer:时空 Transformer 玩转多摄像头 BEV 感知

BEVFormer 开创了基于可学习 BEV queries 的时空 Transformer 感知范式,用空间交叉注意力从多视图图像采样特征、用时间自注意力沿时序聚合信息。它纯靠多摄像头就在 nuScenes 上达到 56.9% NDS 逼近 LiDAR 基线。此后几乎所有端到端驾驶方案都沿用其 BEV query+时序融合的基本设计。

2026年7月19日 · 3 分钟 · 498 字 ·