端到端自动驾驶模型架构全解:从感知到规划的六大范式与 80+ 模型逐篇拆解

一、为什么写这篇文章 本博客陆续精读了 100+ 篇自动驾驶与机器人模型论文——从感知基座(BEVFormer/Sparse4D),到显式端到端(UniAD/VAD/SparseDrive),到打分式(CLOVER/Hydra-MDP/GTRS),到扩散与 Flow 生成(DiffusionDrive/TransDiffuser/GoalFlow),再到 VLA 大模型(DriveVLM/EMMA/AutoVLA/LinkVLA)与世界模型(Cosmos/DriveFuture/WoTE)。单独看是逐篇精读,放在一起,端到端自动驾驶在 感知 → 预测 → 决策 → 规划 四个架构维度上的演进脉络其实非常清晰。 这篇文章把博客里所有精读过的模型收进同一个坐标系,回答三个问题: 感知:从稠密 BEV 到稀疏 query 再到纯视觉 token、几何寄存器,一路在换什么? 预测/决策/规划:从显式管线到打分排序、扩散生成、Flow 整流、LLM 推理、世界模型 roll-out,谁在取代谁?谁融合了谁? 谁真正有效:把彼此在 NAVSIM 上的 PDMS/EPDMS 分数和架构创新对照起来,看看分数到底来自技巧还是来自架构。 本文每个模型给"流派 → 核心创新 → 架构拆解(骨干/模块/输出/训练) → 代表分数“四个维度,尽量讲清楚架构;分数严格区分官方排行榜与 arXiv 自报,口径不一致处会注明。机器人侧的 VLA 模型(RT 系列、π0)作为同源背景单列一节——它们定义了「动作 token」「动作分块」「Flow 动作头」这三个被驾驶侧反复借用的组件。 二、先立坐标系:六大流派一张图 按「感知表征 × 规划输出方式」两个维度,我把博客里的方法归为六大流派: 流派 代表模型 核心思想 感知表征 规划输出 ① 显式端到端管线 UniAD、VAD、VADv2、SparseDrive、PARA-Drive、DriveTransformer、TransFuser 感知/预测/规划在同一个可训练网络里串起来 稠密 BEV / 稀疏 token / 寄存器 单条/多条轨迹回归 ② 评分排序式 (Scoring) CLOVER、Hydra-MDP、GTRS、SparseDriveV2、TOAD、GoalFlow 大量生成候选,再学打分器(或用搜索/流)选出最优 稀疏特征 / 轨迹词汇表 / 目标点 从候选集合中选 Top-1 ③ 扩散/Flow 生成式 DiffusionDrive、DiffusionPlanner、TransDiffuser、SafeDiffuser、FeaXDrive、Gen-Drive 把规划当成从噪声里生成(DDPM / Flow Matching / 整流流) 稀疏感知 / BEV / 图像 多模态轨迹生成 ④ VLA 大模型式 DriveVLM、EMMA、AutoVLA、LinkVLA、OneVL、LaST-VLA、WCog-VLA LLM/VLM 做感知+推理+决策,语言或 token 输出动作 视觉 token / 稀疏 query / 隐 token 语言决策 / 轨迹 token ⑤ 世界模型式 Cosmos、DriveFuture、WoTE、DreamerV3、DLWM、RAW2Drive、ReWorld 建模环境动力学/未来状态,以未来为条件或打分规划 隐潜 / 视频 token / BEV 未来帧 条件化/打分/rollout 规划 ⑥ 数据与评测基建 Bench2Drive、CARLA、K-Risk、MOSAIC、重卡数据集族 提供闭环基准、数据选择、仿真、安全分析 — — 一句话直觉:① 是"手拉手串行提线木偶”,② 是"多打几遍再挑",③ 是"从噪声里一遍遍画",④ 是"读得懂交规再动手",⑤ 是"先在脑内模拟未来再决定",⑥ 是"让前面所有流派有地方比"。六大流派不是互相淘汰,而是逐层叠加——今天最强的系统几乎都是 ②③⑤ 的混合。 ...

2026年8月10日 · 11 分钟 · 2231 字 · 

纯视觉端到端模型在 Cosmos 风格迁移加持下的 NAVSIM 大规模评测:11 个开源模型全景

0. 写在前面:我们需要一份"会晒黑的评测" 现阶段启用的 benchmark 大多默认天气晴朗、光照良好、纹理干净,视觉端到端模型的感知在这个"温室"里表现优秀。但当复用习惯了晴天的视觉 planner 进入真实世界——阴雨路面积水反光、雪天车道线被覆盖、黄昏光照死黑——它的 No-at-fault Collision 和 Drivable Area Compliance 往往断崖式下跌。“能不能开"和"换了个风格还能不能开"是两种能力。 课题组这一轮想做的,就是用 Cosmos(NVIDIA 的世界基础模型)做光照/天气/纹理的风格迁移(rain / snow / 日夜 / 模糊),在不改变场景拓扑、导航指令和 agents 语义的前提下,把同一份 NAV 场景"换皮”,得到一组视觉域被扰动、但语义标签不变的评测集,然后再跑纯视觉 end-to-end 模型在 NAV 上的 PDMS。这样我们拿到的不只是一个数字,而是一张"模型在位姿、外观扰动下的鲁棒性画像",可以回答:哪个模型在风格漂移下最硬?哪个只在晴天强? 0.1 选型逻辑:为什么是这 11 个 入选标准明确,缺一不可: camera-only(纯视觉):必须只吃相机输入,不能依赖 LiDAR 点云。这样"风格迁移只改图像"才能干净地、真实地作用到模型输入上。 NAV 可跑:官方有 NAV 相关权重或可复现配置,能进入我们的批量评测管线(Agent API 封装)。 论文开源:能从 arXiv 拿到原文架构与打分细节。 覆盖技术谱系:从规则化生成型(LTF)到高分辨率稀疏语义 (SparseDriveV2)、proposal 中心式(iPad)、扩散/飞流式(DrivoR、Drive-JEPA、DriveLaW)、再到 VLA 语言世界模型(ChainFlow-VLA、AutoVLA、ReCogDrive、DriveVLA-W0)——我们想测的是"在哪一种范式上,风格迁移造成的伤害最小"。 于是,最终敲定了下面 11 个:SparseDriveV2、iPad、DrivoR、ChainFlow-VLA、AutoVLA、ReCogDrive、DriveVLA-W0、Drive-JEPA、DriveSuprim、DriveLaW、LTF(Latent TransFuser)。 下面我会给每个模型:一句话定位 → 架构解读(附 arXiv 原文架构图)→ 官方资源(仓库/HF)→ 评测配置 → NAV 得分 → 在我们风格迁移评测里值得画的重点。 ...

2026年8月7日 · 5 分钟 · 1029 字 · 

如何在NAVSIM刷到PDMS 90分以上

引言 NAVSIM 排行榜的竞争已经到了白热化阶段。从最初的 80 分出头到现在的 94.5 分(CLOVER),短短两年时间,顶尖方案的 PDMS 提升了 15 个点。如果你正在读这篇文章,大概率是两种人:一是想在排行榜上刷个高分的选手,二是研究自动驾驶规划、想理解 Scoring-based 范式演进方向的研究者。 这篇文章不讲虚的,直接切入正题:到底怎么才能在 NAVSIM 上把 PDMS 刷到 90 分? 我会结合 NAVSIM 排行榜上所有公开的高分方案(CLOVER、CLEAR、DriveFuture、Hydra-MDP 以及各种 VLA + RL 方案),从 PDMS 公式的数学结构出发,逐层拆解每个分数段的瓶颈和对应的策略。 先给个核心结论:PDMS 90+ 的秘密不在于模型多强大,而在于你是否真正理解了 Scoring 范式的每个环节。 一、PDMS 公式:分数结构决定了优化策略 如果你还不知道 PDMS 怎么算的,那先把这块搞清楚。分数结构本身就在告诉你该优化什么。 PDMS 公式拆解 1.1 公式结构 记住这个公式: PDMS = NC × DAC × (5·EP + 5·TTC + 2·C) / 12 这里最应该引起你注意的是乘性结构:NC 和 DAC 是乘法项,意味着任何一个为零,整体分数直接归零。这不是简单的加减法,这是一个"安全第一,前进第二"的奖励结构。 加性部分是 (5·EP + 5·TTC + 2·C) / 12,EP 和 TTC 各占 5 份权重,C 只占 2 份。 ...

2026年7月22日 · 11 分钟 · 2327 字 · 

NAVSIM 排行榜深度分析:谁在统治端到端规划?架构、创新与分数全解

NAVSIM 已成为端到端规划的事实标准benchmark,PDMS/EPDMS排行榜上群雄逐鹿。本文系统梳理navtest/navhard双榜Top方法,从Scoring-based、Diffusion-based、VLA、World Model 四大技术路线解构各家架构设计与核心创新,严格区分官方排行榜已录结果与arXiv宣称结果,并深入拆解 PDMS 每个子指标(NC/DAC/TTC/EP/C)的内部计算方式与撞车实例。数据截至2026年7月。

2026年7月19日 · 19 分钟 · 3991 字 · 

端到端驾驶评测指标全景

一、引言 端到端自动驾驶模型的快速发展对评测体系提出了迫切需求。从早期的行为克隆论文仅报告 L2 位移误差,到如今 NAVSIM、nuPlan、Bench2Drive、CARLA 等多个基准各自定义复杂的复合指标,评测指标呈现出"从单一到综合、从开环到闭环、从粗粒度到细粒度"的演进趋势。 然而,指标选择本身也成为了一个需要深思熟虑的问题——不同的指标反应驾驶质量的不同侧面,单一指标往往存在偏差。理解每个指标的设计动机、计算细节和局限性,是做出可信研究的必要条件。 本文系统梳理端到端驾驶评测领域的主流指标,涵盖开环指标、闭环综合指标、按场景分解指标以及成功率等,并分析各指标之间的关联与互补关系。 二、开环评测指标 开环指标衡量模型预测轨迹与人类真值轨迹之间的差距,虽然不直接反映真实驾驶能力,但因其计算简单、可复现性强而被广泛使用。 2.1 L1/L2 位移误差 定义:在未来时刻 t(通常取 1.0s、2.0s、3.0s)上,预测位置与真值位置之间的距离。 公式: L A F 2 D D _ E E t = = = 1 | | / P P T _ _ ) p p r r × e e d d Σ ( ( _ T t t ) ) - - | P P P _ _ _ p g g r t t e ( ( d T t ( ) ) t | | | | ₂ ₂ - P _ g t ( t ) | | ₂ 解读:L2 误差越小越好,但存在显著的饱和效应——当误差降到一定程度后,进一步降低 L2 未必意味着更好的驾驶能力。更严重的问题是:L2 误差对轨迹的"合理性"完全不敏感,一个不安全的急刹车轨迹和一个安全的平稳减速轨迹可能有相同的 L2 误差。此外,L2 误差也无法区分横向偏差和纵向偏差——偏离车道 0.5 米和速度偏差 5 km/h 可能产生相同的 L2 值。 ...

2026年7月19日 · 5 分钟 · 882 字 · AutoDriving Blog ·