论文精读|DriveVLM:把大语言模型推理能力搬上自动驾驶
DriveVLM 是首个系统性地把视觉语言模型用于自动驾驶场景理解与推理的工作。它提出双系统架构——VLM 慢系统做思维链推理输出高层决策,传统规划器快系统做安全执行。在 CARLA 闭环评测中大幅超越基线,为 VLA 的 Dual-System 范式奠定基础。
DriveVLM 是首个系统性地把视觉语言模型用于自动驾驶场景理解与推理的工作。它提出双系统架构——VLM 慢系统做思维链推理输出高层决策,传统规划器快系统做安全执行。在 CARLA 闭环评测中大幅超越基线,为 VLA 的 Dual-System 范式奠定基础。
VLA 模型将视觉理解、语言推理和动作执行统一到一个端到端网络中,引入大语言模型的常识推理能力解决自动驾驶长尾场景问题。本文剖析其视觉编码器、LLM 与动作头的标准三组件架构,以及从 LLaVA、RT-2、DriveVLM 到 VLA 的完整演进路线。VLA 正成为后端到端时代自动驾驶的新技术范式。
VLM(视觉语言模型)是 VLA 的视觉理解基础。本文从 CLIP 奠基到 GPT-4V/Gemini 前沿,系统梳理架构演进(ViT → Q-Former → LLM)、训练三阶段(对齐→指令微调→RLHF)及驾驶 VLM 的适配方案。