个人思考|VLA 都有了视觉编码器,为什么还需要感知模块?

VLA(Vision-Language-Action)模型自带 ViT 视觉编码器,为什么自动驾驶还需要 3D 检测、BEV 感知、占用网络这些传统感知模块?它们之间到底是替代关系还是互补关系?本文从 14 篇论文精读出发,盘点感知与 VLM 的十种协同模式,详解有 BEV 与无 BEV 感知的实现方法,并解释为什么只有 2D 相机、没有显式 BEV/occ 的模型也能表现不错——关键在于区分’感知任务’与’显式感知表示’。

2026年7月27日 · 9 分钟 · 1851 字 · 

论文精读|SparseOccVLA:稀疏占用查询桥接 Occupancy 与 VLM,实现统一 4D 场景理解与规划

SparseOccVLA 用稀疏占用查询作为视觉与语言之间的单一桥梁,彻底摆脱 ViT patch token,让 LLM 在统一框架内同时完成场景理解、占用预测和轨迹规划。在 OmniDrive-nuScenes 上 CIDEr 提升 7%,Occ3D-nuScenes mIoU 提升 0.5,nuScenes 规划指标达 SOTA。

2026年7月27日 · 4 分钟 · 806 字 ·