什么是 VLA(Vision-Language-Action)模型?
VLA 模型将视觉理解、语言推理和动作执行统一到一个端到端网络中,引入大语言模型的常识推理能力解决自动驾驶长尾场景问题。本文剖析其视觉编码器、LLM 与动作头的标准三组件架构,以及从 LLaVA、RT-2、DriveVLM 到 VLA 的完整演进路线。VLA 正成为后端到端时代自动驾驶的新技术范式。
VLA 模型将视觉理解、语言推理和动作执行统一到一个端到端网络中,引入大语言模型的常识推理能力解决自动驾驶长尾场景问题。本文剖析其视觉编码器、LLM 与动作头的标准三组件架构,以及从 LLaVA、RT-2、DriveVLM 到 VLA 的完整演进路线。VLA 正成为后端到端时代自动驾驶的新技术范式。
世界模型让 AI 在脑中预演未来,学习现实世界的物理规律与交通规则后生成逼真的驾驶场景。本文对比生成式(像素空间预测)与表征式(潜在空间预测)两大流派各自的哲学与优劣。世界模型是解决自动驾驶真实数据稀缺与长尾场景覆盖的核心基础设施。
端到端自动驾驶将传感器输入直接映射到控制输出,消除了模块化方案中的误差累积与信息瓶颈问题。本文梳理从隐式端到端到显式端到端再到生成式大模型的三代架构演进,对比 UniAD、VAD、VLA 等代表性方案。为理解这一技术路线提供了完整的历史脉络与趋势展望。
Flow Matching 通过直接学习从噪声到数据的直线 ODE 路径,解决了扩散模型弯曲路径导致采样步数过多的问题。本文从数学直觉出发讲解向量场、ODE 与流的核心概念,并对比 CFM、Rectified Flow、OT路径等关键变体。与普通教程不同的是,本文所有代码均来自 ByteDance Bagel / Flow-GRPO 的真实项目实现,包含 CFG 推理、SDE 采样、GRPO 策略优化等工业级代码讲解。
BEV 感知将多摄像头画面统一重投影到以自车为中心的鸟瞰图空间,解决了透视图像到度量空间的根本矛盾。本文详细讲解 LSS 与 Transformer 两条主流视角变换路线,以及 BEVFormer 等代表方法的架构设计。BEV 已是现代端到端自动驾驶感知系统的事实标准中间表示。
NAVSIM 是当前自动驾驶规划领域最重要的开环评测基准,几乎所有端到端新工作都在上面比拼 PDMS 分数。它基于 OpenScene 数据设计了非反应式仿真框架,以 PDMS/EPDMS 为核心指标抛弃传统 L2 误差思路。是端到端规划从学术研究走向工业落地的关键度量工具。
3D 坐标系统是自动驾驶感知的数学基石。本文详解六大坐标系(世界、自车、相机、LiDAR、BEV、图像像素)的定义与变换关系,覆盖针孔投影、内外参标定、3D↔2D 投影流程,以及 BEVFormer 等模型中的坐标变换设计。理解坐标系统就等于理解了感知流水线的数学骨架。
Flow-GRPO 将 Group Relative Policy Optimization 引入流匹配策略训练,让扩散/流匹配模型不再只靠模仿学习,而是能通过奖励信号自主探索更优的驾驶策略。它采用 ODE-to-SDE 转换与 Denoising Reduction 技术,在 SD3、FLUX 等模型上验证了有效性。为生成式模型在自动驾驶规划中的强化学习优化提供了全新范式。
在线高精地图构建是自动驾驶感知的核心模块之一,它从传感器数据中实时重建车道线、边界、路口等道路元素。本文详解 HDMapNet、MapTR、VectorMapNet 等代表性方案的技术路线,覆盖分割→向量化、端到端 Transformer 解析、车道图构建,以及地图在规划中的约束作用。
JEPA 是 Yann LeCun 提出的自监督表征学习框架,核心思想是在嵌入空间做预测而非重建像素,避免了对决策无关细节的浪费。它采用双编码器加预测器的架构,配合 EMA 目标编码器与 stop-gradient 机制实现稳定训练。在自动驾驶世界模型中已成为生成式方法的重要替代方案。
数据是自动驾驶系统的燃料。本文系统梳理 2D/3D/Temporal 标注的规范与工具,介绍自动标注(auto-labeling)、NeRF/3DGS 数据生成等前沿范式,覆盖 nuScenes、Waymo 等主流数据集和 corner case 挖掘策略。
AlpaSim 是一个面向强化学习训练与评测的自动驾驶仿真框架,支持闭环训练、多场景评测和安全验证。它采用微服务架构与神经渲染引擎 NRE,兼顾传感器保真度与横向可扩展性。是连接驾驶策略训练和部署验证的关键基础设施。
模型部署是将训练好的深度学习模型转换、优化并部署到车端推理引擎的过程。本文讲解 ONNX/TensorRT 的核心概念、FP16/INT8 量化原理、VLA 大模型的边缘部署挑战,以及 Orin 等主流车端硬件的技术参数。
GRPO 用’组内相对优势’替代 PPO 的 critic 网络,大幅降低大模型强化学习的训练成本与显存开销。它通过对同一 prompt 采样一组回答并基于组内奖励均值做基线来实现策略优化。已在 DeepSeek-R1 及自动驾驶项目 AlphaDrive、Flow-GRPO 中成为首选 RL 算法。
从 ViT 到 ConvNeXt,视觉架构在 Transformer 与卷积之间完成了一个轮回。本文系统梳理 ViT 的核心机制(patch embedding、position encoding、class token),详解 DeiT、Swin、ConvNeXt 等关键演进,并分析多尺度特征金字塔与 VLA 视觉编码器的选型逻辑与缩放定律。
PPO 通过 clipped surrogate objective 和 GAE 实现稳定策略更新,是 RLHF 时代的核心算法。本文从 REINFORCE 出发,拆解 PPO 的每个关键组件,并对比 GRPO 的革新——去掉 critic,用组内相对优势替代。最后梳理 PPO/GRPO 在 VLA 驾驶模型(AlphaDrive、ReCogDrive、DriveVLA-W0)中的应用。
VLM(视觉语言模型)是 VLA 的视觉理解基础。本文从 CLIP 奠基到 GPT-4V/Gemini 前沿,系统梳理架构演进(ViT → Q-Former → LLM)、训练三阶段(对齐→指令微调→RLHF)及驾驶 VLM 的适配方案。
Reward 函数决定了驾驶强化学习的性能天花板,必须在安全、舒适、合规、效率之间艰难权衡。本文系统拆解 reward 设计的四大组件(安全、舒适、合规、效率)、三大范式与常见陷阱。同时梳理了 NAVSIM、nuPlan 等评测指标如何反哺 reward 设计,为驾驶 RL 提供实操指南。
DINOv2、SAM、Depth Anything、CLIP 等视觉基础模型正在深刻重塑自动驾驶的技术栈。本文详解它们各自的核心能力——自监督特征、可提示分割、单目深度估计、视觉-语言对齐——并分析在 VLA 和世界模型论文中作为冻结主干、教师模型和伪标签生成器的三种主要使用范式。
LLM 是 VLA 的’大脑’,提供推理与常识能力。本文深入 Transformer decoder 架构(因果注意力、KV Cache、RoPE、SwiGLU、GQA)、MoE(DeepSeek-V3 风格)、Scaling Laws 以及 VLA 中常用的 LLM 系列(Qwen-2.5、InternLM、Llama-3)。