技术博客

自动驾驶 VLA · 世界模型 · 端到端 · 前沿论文精读与知识分享

📅 2026
JUL 19
知识精讲|自动驾驶定位基础
系统讲解自动驾驶定位技术核心:GNSS/RTK、IMU、车轮里程计的基本原理,卡尔曼滤波的预测-更新过程,多传感器融合的松耦合与紧耦合方案,以及基于HD地图与点云匹配的定位方法,并分析VLA时代定位技术的新角色。
定位 卡尔曼滤波 多传感器融合 SLAM HD地图
JUL 19
知识精讲|相机成像原理与标定
深入讲解自动驾驶中相机成像的核心原理,包括针孔模型、内参外参、畸变模型与标定流程,并分析相机标定质量对BEV感知与3D检测的影响,以及常见车载相机类型。
相机标定 计算机视觉 BEV感知 传感器
JUL 19
知识精讲|LiDAR点云处理基础
系统讲解LiDAR工作原理(ToF、机械/固态)、点云表示方法(xyz、intensity、ring)、三类主流点云检测方法(voxel-based、point-based、range-view),以及在端到端检测中的典型方案(CenterPoint、TransFusion-L)。
LiDAR 点云 3D检测 感知
JUL 19
数据闭环工程:从数据飞轮到持续迭代
数据闭环是自动驾驶系统持续进化的核心引擎,但多数团队卡在「采了很多数据却不会用」的困境。数据闭环的核心难点不在于采集,而在于从PB级数据中精准定位那万分之一的corner case。本文拆解完整数据飞轮(采集→挖掘→标注→训练→评测→回灌),重点介绍主动学习采样策略(熵采样/多样性采样/不确定性估计)、场景库建设方法论、以及基于NeRF/3DGS的自动标注与数据增强前沿实践。
🔄 数据闭环 🌀 数据飞轮 🔍 主动学习 📑 场景库 🧠 NeRF
JUL 19
论文精读|Uni-World VLA — 交错世界建模与规划实现闭环交互驾驶
现有世界模型通常先生成完整未来视频再规划(开环想象),但这种方式忽略了规划决策对环境的实时反馈。Uni-World VLA 提出交错生成范式——模型逐帧交替预测未来画面和自车动作,形成世界建模与控制的闭环交互。同时引入单目深度图作为几何线索增强空间感知。在 NAVSIM 上以单目 RGB 达到 89.4 PDMS,超越多传感器融合方法。
VLA 世界模型 端到端自动驾驶 交错生成 闭环规划
JUL 19
论文精读|DriveFuture:未来感知潜在世界模型——以未来状态条件化当前规划的 SOTA 范式
现有潜在世界模型将未来状态视为预测目标而非规划条件,导致当前与未来特征纠缠。DriveFuture 提出以未来世界状态显式条件化当前决策的框架:训练时用 GT 未来潜在状态做条件,推理时用预测的未来状态接替,实现统一的规划导向 foresight 机制。在 NAVSIM v2 navhard 上以 55.5 EPDMS 排名第一,navtest 上达到 89.9 EPDMS 和 90.7 PDMS。
世界模型 VLA 端到端自动驾驶 规划 NAVSIM
JUL 19
论文精读|AutoDrive-P³:感知-预测-规划链式思维的统一强化微调——ICLR 2026 端到端驾驶新范式
当前 VLM 驾驶方案要么直接输出规划缺失 CoT 推理,要么将感知-预测-规划割裂为独立模块缺乏协同。AutoDrive-P³ 提出统一链式思维框架,通过 P³-CoT 数据集构建感知→预测→规划的结构化推理链,再用 P³-GRPO 算法进行分层渐进式强化微调——将奖励从规划反传到感知和预测模块,实现三模块联合优化。在 NAVSIM 上达到 89.9 EPDMS,nuScenes 上取得最低碰撞率。
VLA CoT GRPO 强化学习 端到端自动驾驶
JUL 19
论文精读:UniDriveVLA — Mixture-of-Transformers 解耦感知-推理冲突的统一驾驶 VLA
UniDriveVLA 提出 Mixture-of-Transformers 架构,通过理解/感知/规划三个专家解耦感知-推理冲突,结合 Masked Joint Attention 与稀疏感知范式,在 nuScenes 开环和 Bench2Drive 闭环上均达到 SOTA。
VLA Mixture-of-Transformers 端到端自动驾驶 3D感知 稀疏感知
JUL 19
论文精读:Hydra-MDP — End-to-end Multimodal Planning with Multi-target Hydra-Distillation
Hydra-MDP 提出多教师知识蒸馏框架,从人类示范教师(模仿人类轨迹)和规则教师(碰撞/可行驶区域等闭环指标)中同时学习,用多头解码器集成多样化轨迹候选。它以端到端可微分的方式统一了模仿学习和闭环指标优化,在 CVPR 2024 Navsim 挑战赛获得第一名,证明了多目标蒸馏范式在驾驶规划中的有效性。
VLA 端到端自动驾驶 知识蒸馏 规划 Navsim
JUL 19
论文精读:FeaXDrive — Feasibility-aware Trajectory-Centric Diffusion Planning
FeaXDrive 发现噪声中心扩散规划与轨迹可行性空间存在根本错位,提出轨迹中心扩散框架,通过自适应曲率正则化训练、可行驶区域引导推理和可行性感知 GRPO 后训练系统提升轨迹物理可行性。在 NAVSIM 上达 88.7 PDMS (IL) / 90.0 PDMS (RL),曲率违反率从 8.59% 降至 0.88%。
扩散模型 端到端自动驾驶 规划 GRPO 轨迹可行性
JUL 19
开环评测 vs 闭环评测深度解析
一、引言 在自动驾驶规划算法的研发流程中,评估方法的选择直接影响研究者对模型能力的判断。目前两类主流的评估范式——开环评测(Open-loop Evaluation)与闭环评测(Closed-loop Evaluation)——各有理论基础和适用范围,但二者之间存在显著的鸿沟。 NAVSIM 论文《Can We Also Drive in Closed-loop?》通过系统性实证研究揭示了这一鸿沟的严重程度:开环评测中的 L2 误差与闭环驾驶质量之间的 Pearson 相关系数仅约 0.3。这意味着一个在开环评测中排名第一的模型,在真实闭环部署中可能完全不合格。越来越多的研究者开始呼吁抛弃"开环迷信",转向更可靠的闭环评估或混合评估策略。 本文将从原理、方法、指标和实证分析四个维度,全面解析这两种评测范式,帮助研究者在论文写作和模型选择中做出更准确的判断。 二、开环评测 2.1 基本定义 开环评测的核心流程如下: 从已录制的驾驶数据集中取出一个片段 将历史观测数据(图像、点云、高精地图等)输入规划模型 模型输出未来一段时间的 EGO 预测轨迹 将预测轨迹与人类驾驶员在 log 中的实际轨迹(ground truth)进行比较 计算误差指标 关键特征在于:评测过程中,模型不会接收到自身决策的反馈。每一步的输入都来自真实 log 数据,与模型的预测无关。 2.2 数据流示意 t t t = = = 0 1 2 : : : 观 观 观 测 测 测 x x x ₀ ₁ ₂ → → → 模 模 模 型 型 型 → → → 预 预 预 测 测 测 ŷ ŷ ŷ ₀ ₁ ₂ ( ( x x ₁ ₂ 来 来 自 自 l l o o g g , , 与 与 ŷ ŷ ₀ ₀ 、 无 ŷ 关 ₁ ) 无 关 ) 这种"教师强制(Teacher Forcing)“模式下,模型的一步预测误差不会传播到下一步——每一步都是独立比较。
评测 开环 闭环 NAVSIM 仿真
JUL 19
分布式训练的工程实践:从DeepSpeed到3D并行
大模型训练需要分布式系统支持,但3D并行(数据并行/张量并行/流水线并行)的配置与调优极为复杂。本文从单卡训练痛点出发,系统讲解DeepSpeed的ZeRO stages、Megatron-LM的张量切片策略、流水线并行的micro-batch调度,以及VLA模型训练中activation checkpointing与通信拓扑选择的工程经验。
🚗 分布式训练 ⚡ DeepSpeed 🔗 3D并行 💾 ZeRO 🤖 Megatron-LM
JUL 19
端到端驾驶评测指标全景
一、引言 端到端自动驾驶模型的快速发展对评测体系提出了迫切需求。从早期的行为克隆论文仅报告 L2 位移误差,到如今 NAVSIM、nuPlan、Bench2Drive、CARLA 等多个基准各自定义复杂的复合指标,评测指标呈现出"从单一到综合、从开环到闭环、从粗粒度到细粒度"的演进趋势。 然而,指标选择本身也成为了一个需要深思熟虑的问题——不同的指标反应驾驶质量的不同侧面,单一指标往往存在偏差。理解每个指标的设计动机、计算细节和局限性,是做出可信研究的必要条件。 本文系统梳理端到端驾驶评测领域的主流指标,涵盖开环指标、闭环综合指标、按场景分解指标以及成功率等,并分析各指标之间的关联与互补关系。 二、开环评测指标 开环指标衡量模型预测轨迹与人类真值轨迹之间的差距,虽然不直接反映真实驾驶能力,但因其计算简单、可复现性强而被广泛使用。 2.1 L1/L2 位移误差 定义:在未来时刻 t(通常取 1.0s、2.0s、3.0s)上,预测位置与真值位置之间的距离。 公式: L A F 2 D D _ E E t = = = 1 | | / P P T _ _ ) p p r r × e e d d Σ ( ( _ T t t ) ) - - | P P P _ _ _ p g g r t t e ( ( d T t ( ) ) t | | | | ₂ ₂ - P _ g t ( t ) | | ₂ 解读:L2 误差越小越好,但存在显著的饱和效应——当误差降到一定程度后,进一步降低 L2 未必意味着更好的驾驶能力。更严重的问题是:L2 误差对轨迹的"合理性"完全不敏感,一个不安全的急刹车轨迹和一个安全的平稳减速轨迹可能有相同的 L2 误差。此外,L2 误差也无法区分横向偏差和纵向偏差——偏离车道 0.5 米和速度偏差 5 km/h 可能产生相同的 L2 值。
评测指标 端到端 PDMS 驾驶分数 自动驾驶
JUL 19
车端C++开发实战:从Python原型到生产级代码
自动驾驶车端代码必须用C++满足实时性要求,但研究团队往往只有Python经验。本文梳理从PyTorch原型到车端C++部署的关键转换:TensorRT C++ API调用、CUDA kernel手写优化、内存管理策略、线程安全与锁设计、以及车端常见的IPC通信机制。
💻 C++ 🐍 Python 🔌 TensorRT 🖥️ CUDA 🧠 内存管理
JUL 19
Scaling Law与数据策略:训好大模型的工程法则
模型越大越好是一个粗糙的直觉,实际工程中需要在计算预算、数据配比、模型容量之间找到最优平衡。本文讲解scaling law的核心公式与迁移规律、数据混合配比的经验法则、训练曲线异常诊断、以及VLA模型训练中的数据预处理Pipeline与curriculum learning策略。
Scaling Law 数据策略 计算预算 数据配比 训练诊断
JUL 19
nuScenes数据集详解
一、概述 nuScenes 是由 Aptiv(现 Motional)与 nuTonomy 团队于 2019 年发布的大规模自动驾驶多模态数据集,也是最早提供完整传感器套件标注的全场景数据集之一。它的发布标志着自动驾驶感知研究从单一传感器(仅 LiDAR 或仅 Camera)向多传感器融合的重要转折,极大地推动了 3D 检测、跟踪、预测和规划等多个方向的发展。 nuScenes 包含 1000 个驾驶场景(scene),每个场景时长约 20 秒,步长 20Hz 录制,关键帧以 2Hz 采样标注。数据采集覆盖波士顿和新加坡两个城市——包括城市主干道、居民区、十字路口、环形交叉口、隧道和高速公路等多种路况,以及白天、夜晚、黄昏、雨天等不同光照和天气条件。这种多样性使得基于 nuScenes 训练的模型对光照和天气变化具有更好的鲁棒性。 该数据集的核心价值在于其多模态特性:每辆数据采集车在同一时间戳下同时提供 6 个环视摄像头图像(覆盖 360° 视野)、5 个毫米波雷达点云和 1 个 32 线 Velodyne 激光雷达点云。研究者可以基于这些数据开发真正利用多模态传感器融合的感知算法,也可以分别验证不同传感器配置下算法的性能上限。 二、传感器配置 每一帧数据中,nuScenes 的传感器配置规格与部署位置如下: 2.1 传感器规格 摄像头(Camera):6 个环视摄像头,型号为 Basler ace acA1600-60gc(160 万像素),分别安装于车顶前部(CAM_FRONT)、左前(CAM_FRONT_LEFT)、右前(CAM_FRONT_RIGHT)、左侧(CAM_BACK_LEFT)、右侧(CAM_BACK_RIGHT)和后部(CAM_BACK)。每个摄像头输出 1600×900 像素 RGB 图像,帧率 12Hz,通过硬件同步实现同一时刻的全局快门采集。所有摄像头的水平视野之和覆盖 360°。 激光雷达(LiDAR):1 个 Velodyne HDL-32E 32 线旋转式激光雷达,安装于车顶中心位置,垂直视野范围 -30° 至 +10°(共 40°),水平视野 360°,帧率 20Hz。每帧返回约 80 万个点,波长 905nm,最大探测距离约 100m。点云密度随距离增加而减小,近距离(< 20m)密度最高。
数据集 nuScenes 评测 自动驾驶
JUL 19
nuPlan数据集详解
一、概述 nuPlan 是由 Motional(原 nuTonomy 团队)于 2023 年发布的大规模自动驾驶规划数据集与闭环仿真评测框架。与 nuScenes 主要聚焦感知任务不同,nuPlan 的设计初衷是填补规划领域三个核心空白:缺乏大规模人类驾驶规划数据、缺乏标准化闭环评测指标、以及缺乏可复现的仿真评估协议。 nuPlan 的核心规模数据:1500 小时的人类驾驶数据,覆盖全球四个城市——波士顿(Boston)、匹兹堡(Pittsburgh)、拉斯维加斯(Las Vegas)和新加坡(Singapore)。这些城市的驾驶环境具有显著差异:波士顿的老城区窄路与不规则交叉口、匹兹堡的丘陵道路与桥梁、拉斯维加斯的宽阔多车道网格化道路、新加坡的右舵驾驶与密集高架路网。 nuPlan 最革命性的贡献在于:它不仅是一个数据集,更是一个完整的闭环仿真平台。研究者可以在 nuPlan 仿真环境中部署自己的规划模型,与不同类型的交通参与者(log-replay 或 reactive agent)交互,并从安全性、合规性和通行效率等多个维度自动评估模型表现。这种"数据+仿真+评估"三位一体的设计,使 nuPlan 成为目前自动驾驶规划领域最全面的基准平台。 二、数据采集与统计 2.1 数据规模对比 维度 nuScenes nuPlan 总驾驶时长 约 5.5 小时 约 1500 小时 场景/Log 数 1000 个 scene 约 1282 个 log 标注关键帧 约 40,000 约 150 万 标注 3D 框总数 约 140 万 约 5900 万 覆盖城市 2(波士顿、新加坡) 4(波士顿、匹兹堡、拉斯维加斯、新加坡) 传感器配置 6 Cam + 5 Radar + 1 LiDAR 同 nuScenes(部分 Log 不同) 高精度地图 无 完整 HD Map(车道拓扑、交通标志) 仿真环境 无 内置闭环仿真器 2.2 四城市特点 波士顿:美国东北部老城,街道较窄且不规则,存在大量无保护左转、两阶段左转和环形交叉口。历史街区的道路拓扑复杂,行人活动频繁。冬季还可能遇到积雪和湿滑路面。波士顿的数据量约占全部数据的 30%。
数据集 nuPlan 仿真 闭环评测
JUL 19
NAVSIM 排行榜深度分析:谁在统治端到端规划?架构、创新与分数全解
NAVSIM 已成为端到端规划的事实标准benchmark,PDMS/EPDMS排行榜上群雄逐鹿。本文系统梳理navtest/navhard双榜Top方法,从Scoring-based、Diffusion-based、VLA、World Model 四大技术路线解构各家架构设计与核心创新,严格区分官方排行榜已录结果与arXiv宣称结果,并深入拆解 PDMS 每个子指标(NC/DAC/TTC/EP/C)的内部计算方式与撞车实例。数据截至2026年7月。
NAVSIM 排行榜分析 端到端自动驾驶 PDMS EPDMS
JUL 19
论文精读|ACT + ALOHA:低成本双臂遥操作与动作分块策略
ACT+ALOHA 用不到 2 万美元的开源双臂遥操作平台解决了精细双臂操控的数据获取难题。ACT 采用动作分块(Action Chunking)+CVAE Transformer 的抗复合误差策略,将模仿学习精度推至新高度。ALOHA 的低成本同构主从机械臂设计为具身智能数据采集建立了新范式。
🤖 机器人 🏫 遥操作 ⚡ ACT 🦾 双臂
JUL 19
论文精读:DiffusionDriveV2 — RL-Constrained Truncated Diffusion
DiffusionDriveV2 将强化学习引入截断扩散模型,提出 Intra-Anchor GRPO 和 Inter-Anchor Truncated GRPO,解决了 DiffusionDrive 中多样性与一致高质量之间的根本矛盾。在 NAVSIM v1 上达到 91.2 PDMS,v2 上达到 85.5 EPDMS,均创下新纪录。
🎨 扩散模型 🔁 GRPO 🔗 端到端 📐 轨迹规划 🚗 自动驾驶