个人思考|VLA 都有了视觉编码器,为什么还需要感知模块?

VLA(Vision-Language-Action)模型自带 ViT 视觉编码器,为什么自动驾驶还需要 3D 检测、BEV 感知、占用网络这些传统感知模块?它们之间到底是替代关系还是互补关系?本文从 14 篇论文精读出发,盘点感知与 VLM 的十种协同模式,详解有 BEV 与无 BEV 感知的实现方法,并解释为什么只有 2D 相机、没有显式 BEV/occ 的模型也能表现不错——关键在于区分’感知任务’与’显式感知表示’。

2026年7月27日 · 9 分钟 · 1851 字 · 

个人思考|自动驾驶感知模块全景:从传感器到BEV再到占用网络,到底在感知什么

一篇全景式讲解自动驾驶感知模块的技术文章。从传感器硬件讲起,覆盖3D目标检测、BEV感知、占用网络、语义分割、多目标跟踪,以及它们如何输出给下游的预测和规划模块。附完整感知流水线图。

2026年7月27日 · 4 分钟 · 650 字 · 

论文精读|MAN TruckScenes — 第一个面向重卡自动驾驶的多模态数据集,把 4D 雷达做成 360° 全覆盖

MAN TruckScenes 是 MAN Truck & Bus 与慕尼黑工业大学在 NeurIPS 2024 Datasets & Benchmarks 提出的第一个面向自动驾驶重卡的多模态数据集,含 747 个 20 秒场景、4 相机 + 6 激光雷达 + 6 个 4D 雷达 + 双 IMU + 高精度 GNSS,标注范围超 230 米、27 个物体类、34 个场景标签,并首次提供 360° 覆盖的 4D 雷达点云与带 3D 框标注,配套 nuScenes 格式 devkit 与 CenterPoint/RadarGNN/PETR 基线。本文面向刚入行的 VLA 工程师,用大白话拆解它的传感器布局、卡车特有挑战、标注与切分、以及给端到端重卡模型带来的长距离鲁棒感知问题。

2026年7月20日 · 4 分钟 · 776 字 · 

知识精讲|LiDAR点云处理基础

系统讲解LiDAR工作原理(ToF、机械/固态)、点云表示方法(xyz、intensity、ring)、三类主流点云检测方法(voxel-based、point-based、range-view),以及在端到端检测中的典型方案(CenterPoint、TransFusion-L)。

2026年7月19日 · 3 分钟 · 495 字 ·