论文精读|EMMA:Waymo的多模态端到端驾驶大模型
Waymo 的 EMMA 基于 Gemini 多模态大模型,把所有驾驶任务(感知、预测、规划)统一翻译成自然语言 VQA,用单一模型、一套语言空间端到端处理。它选择直接文本化坐标以最大化复用 Gemini 预训练的世界知识。代表了将 MLLM 作为驾驶系统’一等公民’的前沿探索。
Waymo 的 EMMA 基于 Gemini 多模态大模型,把所有驾驶任务(感知、预测、规划)统一翻译成自然语言 VQA,用单一模型、一套语言空间端到端处理。它选择直接文本化坐标以最大化复用 Gemini 预训练的世界知识。代表了将 MLLM 作为驾驶系统’一等公民’的前沿探索。
PPO 通过 clipped surrogate objective 和 GAE 实现稳定策略更新,是 RLHF 时代的核心算法。本文从 REINFORCE 出发,拆解 PPO 的每个关键组件,并对比 GRPO 的革新——去掉 critic,用组内相对优势替代。最后梳理 PPO/GRPO 在 VLA 驾驶模型(AlphaDrive、ReCogDrive、DriveVLA-W0)中的应用。
VLM(视觉语言模型)是 VLA 的视觉理解基础。本文从 CLIP 奠基到 GPT-4V/Gemini 前沿,系统梳理架构演进(ViT → Q-Former → LLM)、训练三阶段(对齐→指令微调→RLHF)及驾驶 VLM 的适配方案。
Reward 函数决定了驾驶强化学习的性能天花板,必须在安全、舒适、合规、效率之间艰难权衡。本文系统拆解 reward 设计的四大组件(安全、舒适、合规、效率)、三大范式与常见陷阱。同时梳理了 NAVSIM、nuPlan 等评测指标如何反哺 reward 设计,为驾驶 RL 提供实操指南。
DINOv2、SAM、Depth Anything、CLIP 等视觉基础模型正在深刻重塑自动驾驶的技术栈。本文详解它们各自的核心能力——自监督特征、可提示分割、单目深度估计、视觉-语言对齐——并分析在 VLA 和世界模型论文中作为冻结主干、教师模型和伪标签生成器的三种主要使用范式。
PaLM-E是Google与柏林工业大学联合提出的具身多模态语言模型,将PaLM大语言模型与视觉编码器结合,直接处理机器人传感器数据。该模型在562B参数规模下不仅在机器人任务上表现出色,还在OK-VQA等视觉语言基准上达到SOTA,同时保留了强大的语言能力。
NVIDIA DRIVE是自动驾驶行业最主流的车端计算平台,从Orin(254 TOPS)到Thor(2000 TOPS)的演进正在重新定义VLA模型的部署边界。本文从硬件架构出发,讲解Orin/Thor的GPU-CPU-DLA-PVA异构计算单元、内存带宽与瓶颈分析、DRIVE OS与DriveWorks中间件栈、TensorRT在DRIVE上的优化策略(INT8稀疏化/DLA offloading/Multi-Stream调度),以及实际部署VLA模型时的pipeline编排与延迟预算分配经验。
GoalFlow 用一个精准目标点词表加评分机制选出最合理的短期终点,再用 Flow Matching 一步生成多模态驾驶轨迹。它解决了纯扩散生成轨迹发散无边界、而固定锚点约束过强不真实的两难问题。在 NAVSIM 上 PDMS 达到 90.3,验证了’目标点+整流流’高效生成方案的有效性。
LLM 是 VLA 的’大脑’,提供推理与常识能力。本文深入 Transformer decoder 架构(因果注意力、KV Cache、RoPE、SwiGLU、GQA)、MoE(DeepSeek-V3 风格)、Scaling Laws 以及 VLA 中常用的 LLM 系列(Qwen-2.5、InternLM、Llama-3)。
离线 RL 让智能体从静态数据集中学习,无需在线交互,对自动驾驶等安全关键领域至关重要。本文详解 CQL、IQL、TD3+BC 等核心算法,讨论分布偏移与 OOD 动作问题,并梳理离线预训练→在线微调范式在 VLA 驾驶模型中的应用与趋势。
轨迹规划是自动驾驶系统中连接预测与控制的枢纽,其核心任务是在安全、舒适、可行的约束下生成时空轨迹。本文深入讲解 Frenet 坐标系、主流轨迹规划算法分类、碰撞检测与轨迹平滑等核心概念。帮助读者建立从数学基础到工程实践的完整知识框架。
3D 目标检测是自动驾驶感知的核心任务之一。本文从 2D 检测到 3D 检测的额外挑战出发,系统梳理纯视觉、纯 LiDAR 和多传感器融合三大技术路线,分析 DETR3D、BEVFormer、PointPillars、BEVFusion 等代表方法,并探讨在端到端趋势下 3D 检测逐渐被规划吸收的范式转变。
SayCan是Google提出的将大型语言模型与机器人技能结合的方法,通过将LLM的语言知识与机器人技能的可行性(affordance)结合,实现了自然语言指令到长horizon机器人任务的规划与执行。该工作首次展示了LLM如何在真实机器人上落地,开启了LLM+机器人的新范式。
VAD 将整个驾驶场景建模为全向量化表示——地图元素和 agent 运动都变成矢量,彻底抛弃了 UniAD 中的稠密栅格。它通过隐式 query 交互和显式三个向量化规划约束,在保持精度的同时将推理速度提升 2.5-9.3 倍。作为 UniAD 之后最重要的效率改进工作,VAD 为端到端驾驶的实时部署铺平了道路。
RLHF 通过人类偏好反馈将模型行为对齐到人类期望。本文详解 RLHF 三阶段流程、Bradley-Terry 奖励模型、DPO 直接偏好优化,并分析 GRPO 如何避免显式 reward 建模。在驾驶场景中,偏好对齐天然适配’不同人有不同驾驶风格’这一人类直觉——有人偏好激进、有人偏好保守,RLHF 让 VLA 模型学会按需生成驾驶行为。
多模态对齐是 VLA 的’关键桥梁’——它决定视觉信号能否被 LLM 正确理解。本文梳理从对比损失(CLIP)到 Q-Former(BLIP-2)到 MLP 投影(LLaVA)的对齐方案演进,以及 VLA 如何将对齐从’图像→文本’扩展到’图像→动作’,详解连续动作的 tokenization 策略。
强化学习通过试错交互自主优化策略,是继监督学习之后最具潜力的自动驾驶训练范式。本文从 MDP 五元组出发,系统讲解策略梯度、PPO/SAC/DDPG 等主流 RL 算法的数学原理与演进脉络。并深入分析各算法在自动驾驶决策与规划中的适用场景与落地挑战。
运动预测与行为预测是自动驾驶系统理解周围交通参与者的核心技术,其目标是从历史观测中推断其他车辆、行人、骑行者的未来轨迹。本文从问题定义出发,系统梳理输入输出范式、经典架构、多智能体预测、目标条件预测以及评分机制,并分析预测模块在端到端框架中的演进趋势。
Occupancy 网络通过稠密的 3D 体素网格表示场景,突破了 3D 目标检测对“物体”范畴的限制,可表征任意形状的障碍物与自由空间。本文详解其与检测的差异、OccFormer/FlashOcc/OpenOccupancy 等代表架构,以及在 NIFF 等世界模型中 occupancy 如何作为核心场景表示驱动未来预测与规划决策。
Gato是DeepMind提出的通用智能体,通过在604种不同任务上联合训练,用一个Transformer网络同时处理 Atari 游戏、机器人控制、图像描述、文本对话等任务。它证明了单一模型可以掌握多种模态的技能,是迈向通用人工智能的重要一步。