个人思考|VLA 都有了视觉编码器,为什么还需要感知模块?
VLA(Vision-Language-Action)模型自带 ViT 视觉编码器,为什么自动驾驶还需要 3D 检测、BEV 感知、占用网络这些传统感知模块?它们之间到底是替代关系还是互补关系?本文从 14 篇论文精读出发,盘点感知与 VLM 的十种协同模式,详解有 BEV 与无 BEV 感知的实现方法,并解释为什么只有 2D 相机、没有显式 BEV/occ 的模型也能表现不错——关键在于区分’感知任务’与’显式感知表示’。
VLA(Vision-Language-Action)模型自带 ViT 视觉编码器,为什么自动驾驶还需要 3D 检测、BEV 感知、占用网络这些传统感知模块?它们之间到底是替代关系还是互补关系?本文从 14 篇论文精读出发,盘点感知与 VLM 的十种协同模式,详解有 BEV 与无 BEV 感知的实现方法,并解释为什么只有 2D 相机、没有显式 BEV/occ 的模型也能表现不错——关键在于区分’感知任务’与’显式感知表示’。
一篇全景式讲解自动驾驶感知模块的技术文章。从传感器硬件讲起,覆盖3D目标检测、BEV感知、占用网络、语义分割、多目标跟踪,以及它们如何输出给下游的预测和规划模块。附完整感知流水线图。
TruckV2X (IEEE RA-L 2025) 是首个以半挂重卡为中心的 V2X 多模态多智能体协同感知数据集,用 CARLA 仿真构建 64 个场景、88,396 帧点云、百万图像、118 万 3D 框,覆盖牵引车-挂车-CAV-RSU 四类智能体,系统性揭示重卡因车身长、挂车摆动、转弯内侧盲区而对车路协同的刚需。
「UniAD 把感知(检测/跟踪/建图/运动预测/占用)和规划全部塞进一条共享 query 的 Transformer 流水线,是 BEV 端到端感知-规划一体化的开山之作(CVPR 2023 Best Paper)。本文顺着 mmdet3d_plugin 的真实代码,逐个 head 讲清输入输出、forward 里到底做了什么,并拆穿两阶段训练为什么非这么干不可,零基础也能顺着数据流读懂整条链路」
「VAD 在 UniAD 之后走轻量化路线:把 agent、地图、运动全表示成向量(点和线),去掉占用栅格与分割头,VADv2 进一步把规划做成多模态概率分布,是回归式端到端走向生成式选择的关键过渡」
WoTE(ICCV 2025, CASIA)指出:端到端规划器只生成轨迹却「盲目」选轨迹,缺少对未来后果的预判。它用一个 BEV 空间世界模型,给每条候选轨迹 rollout 出未来 BEV 状态,再由奖励模型打分挑最高奖励者。BEV 空间比图像级世界模型省算力,且能直接用 nuPlan 等 BEV 仿真器提供监督。NAVISIM 达 88.3 PDMS,Bench2Drive 闭环 Driving Score 61.71 创 SOTA。
现有自动驾驶多视角生成方法缺乏显式3D建模,仅将问题视为2D图像集合成。BEV-VAE提出在BEV隐空间中进行编码与生成,通过多视角VAE构造统一BEV表征,再以DiT进行潜扩散生成。在nuScenes和Argoverse 2上,BEV-VAE实现了高保真重建与3D一致的多视角生成,并支持新视角合成与3D布局可控生成。