论文精读|DriveVLM-W0 与 DriveWLM 系列:世界模型如何点亮驾驶大模型
DriveVLM 家族从语言 CoT 演进到世界模型统一建模范式,攻克了 VLM 上车面临的监督稀疏、世界与动作割裂、探索不安全三道坎。DrivingGPT 用 VQ-VAE 把图像与动作离散化为统一词表,将驾驶建模为 next-token 预测。DriveVLM-RL 借鉴神经科学双通路机制,用离线 RL 为驾驶安全兜底。
DriveVLM 家族从语言 CoT 演进到世界模型统一建模范式,攻克了 VLM 上车面临的监督稀疏、世界与动作割裂、探索不安全三道坎。DrivingGPT 用 VQ-VAE 把图像与动作离散化为统一词表,将驾驶建模为 next-token 预测。DriveVLM-RL 借鉴神经科学双通路机制,用离线 RL 为驾驶安全兜底。
CoT(思维链)让 VLA ‘想清楚再做’,将驾驶决策过程拆解为可解释的推理步骤。本文从 CoT 基础(Few-shot / Zero-shot / Self-consistency)出发,详解 DriveVLM 的场景描述→预测→推理→规划四阶段 CoT、WCog-VLA 的博弈论 Game-CoT、视觉 DCoT,以及 GRPO + CoT 联合训练的 AlphaDrive 范式。
Scoring-based 规划范式是当前端到端自动驾驶规划的主流方法论之一,其核心思想是:先生成多个候选轨迹,再通过学习一个评分网络选出最优轨迹。本文系统性梳理从 BC 回归到多模态评分、扩散采样到强化学习的方法演进,详细解析 Vocabulary-based、动态生成、扩散三类核心范式,并深入 ScoreNet 的设计哲学与关键论文脉络。
扩散模型通过逐步加噪与逆向去噪实现从纯噪声到高质量数据的生成,已成为 GAN 之后最强大的生成范式。本文从 DDPM 的数学推导出发,详细讲解正向加噪过程、反向去噪网络以及条件生成方法。同时梳理了扩散模型在自动驾驶场景生成、轨迹规划中的数据增强应用全景。
逆强化学习(IRL)解决的是’从行为反推动机’的问题——给定专家演示,推断 driving force 背后的 reward 函数。本文详解最大熵 IRL、GAIL/AIRL 对抗方法,阐明 IRL 与 BC、RL 的本质区别,并梳理 IRL 在自动驾驶中的应用:从人类驾驶数据中学习 reward,再用 RL 优化策略。最后讨论偏好 IRL 和 VLM 作为 reward 的最新趋势。
Open X-Embodiment是Google联合21家机构打造的跨机器人大规模数据集,包含22种机器人、100万+轨迹数据。基于该数据集训练的RT-X模型首次证明了跨机器人正迁移的可行性,RT-1-X成功率提升50%,RT-2-X泛化能力提升3倍。
Diffusion Planner 把自动驾驶规划重定义为未来轨迹生成任务,用 Diffusion Transformer(DiT)将自车规划与他车预测联合建模为一次条件去噪过程。它通过免训练的分类器引导机制在推理时灵活注入安全、舒适与速度偏好。在 nuPlan 闭环评测中刷新 SOTA,开创了扩散式联合预测-规划的新范式。
Transformer 凭借自注意力机制的长程依赖建模与并行计算能力,从 NLP 席卷至自动驾驶全栈。本文从缩放点积注意力的数学原理出发,系统梳理 Multi-Head Attention、ViT、BEVFormer 及 VLM 中 Causal Attention 的关键技术。为理解 Transformer 在自动驾驶感知与规划中的应用奠定理论基础。
控制模块是自动驾驶系统中连接规划与车辆执行器的关键桥梁。本文深入讲解车辆运动学与动力学基础模型、经典控制方法(PID、LQR、MPC)、轨迹跟踪算法、以及车辆动力学中的关键物理概念。同时分析端到端自动驾驶中控制角色的转变——从传统控制到’waypoint 直接输出’再到’action chunking’的演进逻辑。
DROID是Google联合18家机构打造的大规模真实世界机器人操作数据集,包含76k演示轨迹、564个场景、86个任务,跨越北美、亚洲、欧洲三大洲。实验证明使用DROID训练的策略在性能和泛化能力上平均提升20%。
MAN TruckScenes 是 MAN Truck & Bus 与慕尼黑工业大学在 NeurIPS 2024 Datasets & Benchmarks 提出的第一个面向自动驾驶重卡的多模态数据集,含 747 个 20 秒场景、4 相机 + 6 激光雷达 + 6 个 4D 雷达 + 双 IMU + 高精度 GNSS,标注范围超 230 米、27 个物体类、34 个场景标签,并首次提供 360° 覆盖的 4D 雷达点云与带 3D 框标注,配套 nuScenes 格式 devkit 与 CenterPoint/RadarGNN/PETR 基线。本文面向刚入行的 VLA 工程师,用大白话拆解它的传感器布局、卡车特有挑战、标注与切分、以及给端到端重卡模型带来的长距离鲁棒感知问题。
AlphaDrive 把 DeepSeek R1 式的 GRPO 推理强化学习首次引入自动驾驶规划,将高层驾驶决策建模为元动作分类问题。它设计了四个面向规划的专门奖励,配合 SFT 预热+RL 探索两阶段策略。仅 2B 参数的 Qwen2VL 模型反超 7B 系列,并涌现出’一景多解’的多模态规划能力。
安全是自动驾驶系统的第一性原则。本文系统梳理端到端自动驾驶中的安全机制设计,涵盖碰撞检测与避障、可行驶区域约束、规则安全过滤器、损失函数中的安全项、安全世界模型、主动安全 ADAS 系统及功能安全标准等核心内容。帮助读者构建从算法安全到系统安全的完整认知框架。
自动驾驶依赖多传感器融合来克服单一传感器在弱光、雨雪等场景下的能力边界。本文系统对比摄像头、激光雷达、毫米波雷达等主流传感器的原理与优劣,深入讲解时空同步与多模态融合策略。最后阐述 BEV 作为统一表示空间如何串联感知全链路。
RH20T是上海交通大学推出的超大规模机器人操作数据集,包含110,000+条接触丰富的真实世界操作序列,覆盖147项任务、7种机器人配置。数据集提供视觉、力觉、音频等多模态信息,支持一次性模仿学习研究。
Sparse4D 用全稀疏范式挑战 BEV 感知路线:用稀疏实例 query 直接从多相机图像抠出 3D 目标,绕开计算昂贵的稠密 BEV 特征图。它通过稀疏 4D 关键点采样、循环时序融合和实例去噪三项核心设计,将多摄像头 3D 检测与跟踪做到 nuScenes 顶尖。作为全稀疏感知范式奠基作,后续 SparseDrive 系列在此基础上构建端到端驾驶系统。
视频生成模型是自动驾驶世界模型的核心技术基础。本文从 VQVAE 的离散潜在表征出发,逐步讲解扩散模型从像素到潜在空间的演进、DiT 架构的 Scaling 特性、因果 VAE 在时序建模中的作用,以及驾驶场景下的多相机视频生成方法全景。
Octo 是 UC Berkeley 等团队推出的开源通用机器人策略(GRP),基于 Transformer 架构在 80 万条多机器人轨迹上预训练,支持语言指令和目标图像双模式输入,可通过高效微调适配新机器人平台和动作空间。作为首个完全开源的通用机器人操控策略,Octo 为机器人基础模型的研究奠定了重要基础。
LaST-VLA 把 VLA 推理从文字 CoT 搬进连续隐空间,用 3D 几何先验(VGGT)和世界模型动力学先验(Cosmos)两个外部基础模型当特征级老师,蒸馏监督隐 CoT。它让隐式推理既绕开了文字 CoT 的慢速与幻觉问题,又避免了朴素隐 CoT 的物理脱节。在 NAVSIM 双榜单上用单目前视传感器取得 SOTA,推理时两个老师全部旁路、零额外开销。
世界模型从预测空间维度可分为像素空间、潜在空间和占用空间三大类别,每种都有不同的代表方法与适用场景。本文系统梳理了 DriveDreamer、GAIA-1、Vista、World4Drive、OccWorld 等主流世界模型,对比其核心技术、条件控制与对规划的支持能力,并给出完整的分类体系与发展脉络。