pi0 代码讲解:通用 VLA 的「VLM 主干 + Flow Matching 动作专家」

「pi0 用 Google 的 PaliGemma 视觉语言模型当『懂场景、懂语言』的通用感知-语义主干,再并联挂一个独立的 Flow Matching 动作专家,通过 cross-attention 从 VLM 取特征,在 10 步 ODE Euler 积分内把随机噪声动作流到真实连续动作;本文顺着 Physical-Intelligence 官方 openpi 仓库,逐文件逐函数把 pi0.py 总装两塔、paligemma.py 封装主干、action_expert.py 的 Flow Matching 去噪、trainer.py 的向量场 MSE 损失、runtime.py 的 10 步 ODE 生成、transforms 里的动作 tokenize 与冻结策略讲透,并与 AutoVLA / DriveVLA-W0 做对照,最后把本系列九篇串成一条端到端自动驾驶与通用机器人 VLA 的演进线」

2026年7月20日 · 7 分钟 · 1330 字 · 

UniAD 代码讲解:端到端自动驾驶的「全栈 Transformer」是怎么拼起来的

「UniAD 把感知(检测/跟踪/建图/运动预测/占用)和规划全部塞进一条共享 query 的 Transformer 流水线,是 BEV 端到端感知-规划一体化的开山之作(CVPR 2023 Best Paper)。本文顺着 mmdet3d_plugin 的真实代码,逐个 head 讲清输入输出、forward 里到底做了什么,并拆穿两阶段训练为什么非这么干不可,零基础也能顺着数据流读懂整条链路」

2026年7月20日 · 6 分钟 · 1166 字 · 

VAD 代码讲解:把场景「矢量化」后,端到端能有多轻

「VAD 在 UniAD 之后走轻量化路线:把 agent、地图、运动全表示成向量(点和线),去掉占用栅格与分割头,VADv2 进一步把规划做成多模态概率分布,是回归式端到端走向生成式选择的关键过渡」

2026年7月20日 · 8 分钟 · 1587 字 · 

代码讲解:DiffusionDrive 从架构到训练推理的完整闭环

逐行拆解 hustvl/DiffusionDrive 的真实源码,面向零基础读者:从架构图与全局数据流出发,用大白话讲清什么是 anchor、什么是去噪、什么是 cross-attention、什么是 BEV、什么是截断扩散,再逐文件讲清它如何作为 navsim 的 Agent 插件挂载,最后把一次前向传播拆成 7 到 8 步、把训练和推理的差异讲透。一篇把项目挂载方式→数据流→前向传播→训练梯度→推理选轨迹→个人思考全部讲明白的极详细工程向代码讲解。

2026年7月20日 · 9 分钟 · 1856 字 · 

代码讲解:DiffusionDriveV2 — 用 GRPO 强化学习给截断扩散的多样轨迹「上安全锁」

「DiffusionDriveV2 在 DiffusionDrive 的 anchor 截断扩散之上,补了一套 GRPO 强化学习微调:用 scale-adaptive 乘性噪声做探索、Intra-Anchor GRPO 保住多模态不坍缩、Inter-Anchor Truncated GRPO 用碰撞惩罚把低质量轨迹压下去,最后加两级 Mode Selector 精排,在 NAVSIM v1 上冲到 91.2 PDMS。本文基于论文 Algorithm 还原成逐文件逐函数伪代码,从 cold start 权重加载写到 rollout → advantage → loss 的完整 RL 训练循环。」

2026年7月20日 · 15 分钟 · 3012 字 · 

代码讲解:DriveVLA-W0 世界模型如何给 VLA 大模型补上稠密监督

逐行拆解 BraveGroup/DriveVLA-W0 的已开源代码,面向零基础读者:先讲清 VLA、世界模型、MoE、Flow Matching、FAST tokenizer 等黑话,再厘清仓库边界(只开源了 policy_head 与 tokenizer,VLM 主干在外部库),然后逐文件拆解 MoE 动作专家、Flow Matching 解码器、扩散策略头、动作 tokenizer 与世界模型 VQ 编码器,最后把一次前向从图像到轨迹串成 7 步、讲透两阶段训练与推理旁路世界模型的设计。一篇把代码边界到数据流到关键模块到训练梯度到推理选轨迹到个人思考全部讲明白的极详细工程向代码讲解。

2026年7月20日 · 8 分钟 · 1693 字 · 

代码讲解:SparseDriveV2 因子化轨迹词汇表与两级评分的完整闭环

逐行拆解 swc-17/SparseDriveV2 的真实源码:从架构图与全局数据流出发,用最通俗的大白话讲清几何路径乘以速度剖面如何因子化组合成 26 万条轨迹词汇表、两级评分怎么把候选从 26 万粗筛到 200 条再精排、PDM score 蒸馏损失如何用排行榜判分器当老师。一篇把项目挂载方式、数据流、前向传播、训练梯度、推理选轨迹、个人思考全部讲透、面向零基础读者的工程向代码讲解。

2026年7月20日 · 9 分钟 · 1732 字 · 

论文精读:Drive-JEPA — Video JEPA 预训练 + 多模态轨迹蒸馏的端到端驾驶

Drive-JEPA(2026)指出端到端驾驶的两个瓶颈:(1) 视频世界模型预训练收益有限;(2) 每场景只有一条人类轨迹,多模态监督稀缺。它用 V-JEPA(而非生成式世界模型)在 208 小时驾驶视频上自监督预训练 ViT 编码器,得到规划对齐的表征;再用基于仿真器的「多模态轨迹蒸馏」把多样伪教师轨迹蒸馏进 proposal-centric 规划器,并以动量感知选择抑制帧间抖动。NAVISIM v1 达 93.3 PDMS、v2 达 87.8 EPDMS 双榜 SOTA,仅前视相机+轻量 transformer 即在无感知设定下超此前 SOTA 3 PDMS。

2026年7月20日 · 3 分钟 · 489 字 · 

论文精读:GTRS — 通用轨迹评分(CVPR25 自动驾驶挑战赛冠军)

GTRS(NVIDIA, CVPR 2025 自动驾驶挑战赛 E2E 赛道冠军)指出:现有轨迹评分器要么打「静态大词表」要么打「动态小候选」,两者都泛化差。GTRS 用三根支柱统一二者:(1) 扩散策略生成细粒度动态候选;(2) 在 16384 的超密集词表上训练评分器 + 词表 dropout,使推理时能在更小子集上强泛化;(3) 传感器旋转增强 + top-k 细化自蒸馏,提升域外鲁棒性。Navhard 榜 EPDMS 最高 49.4,逼近依赖真值感知的 PDM-Closed。

2026年7月20日 · 2 分钟 · 314 字 · 

论文精读:WoTE — 用 BEV 世界模型做在线轨迹评估的端到端驾驶

WoTE(ICCV 2025, CASIA)指出:端到端规划器只生成轨迹却「盲目」选轨迹,缺少对未来后果的预判。它用一个 BEV 空间世界模型,给每条候选轨迹 rollout 出未来 BEV 状态,再由奖励模型打分挑最高奖励者。BEV 空间比图像级世界模型省算力,且能直接用 nuPlan 等 BEV 仿真器提供监督。NAVISIM 达 88.3 PDMS,Bench2Drive 闭环 Driving Score 61.71 创 SOTA。

2026年7月20日 · 3 分钟 · 521 字 · 

论文精读|Anti-rollover APF — 用五自由度动力学 + 侧翻排斥势场,让重卡规划阶段就避开翻车

本文精读 Jin 与 He 在 2024 年 Chinese Journal of Mechanical Engineering 发表的 Anti-rollover Artificial Potential Field Motion Planning Method of an Autonomous Heavy Truck Optimised by Game Theory。论文用 5-DOF 重卡动力学模型推导侧翻指标,提出把侧翻排斥势场(anti-rollover APF)融入 MPC 运动规划,并用博弈论优化势场权重,让重卡在规划阶段就同时兼顾避障与防侧翻。面向刚入行的 VLA 工程师,用大白话讲清侧翻机理、LTR 判据、五自由度模型与势场规划框架,并呼应博客 nuTruck 文章。

2026年7月20日 · 4 分钟 · 817 字 · 

论文精读|TruckDrive — 面向重卡的长距离高速公路感知数据集,把感知边界推到 1000 米

TruckDrive 是 Torc Robotics 与普林斯顿大学在 CVPR 2026 提出的面向半挂重卡的高速公路长距离多模态感知数据集,含 47.5 万同步样本、16.5 万密集标注帧,2D 标注延伸到 1000 米、3D 标注延伸到 400 米,配备了 7 台长距 FMCW 激光雷达、10 台 4D 雷达与 11-15 路多焦距相机。本文用大白话拆解其传感器架构(含完整的传感器位置坐标表)、标注流水线、与 nuScenes/ONCE 等数据集的定量对比,并深入分析重卡制动距离公式、高速场景对感知的独特要求(300-500 米安全感知窗口),以及当前 VLA 模型在 150 米处系统性失效的原因。文章还包含感知距离需求对比图、TruckDrive 车辆传感器部署实拍、以及范围分布图等多个可视化素材。

2026年7月20日 · 6 分钟 · 1178 字 · 

NAVSIM 排行榜深度分析:谁在统治端到端规划?架构、创新与分数全解

NAVSIM 已成为端到端规划的事实标准benchmark,PDMS/EPDMS排行榜上群雄逐鹿。本文系统梳理navtest/navhard双榜Top方法,从Scoring-based、Diffusion-based、VLA、World Model 四大技术路线解构各家架构设计与核心创新,严格区分官方排行榜已录结果与arXiv宣称结果,并深入拆解 PDMS 每个子指标(NC/DAC/TTC/EP/C)的内部计算方式与撞车实例。数据截至2026年7月。

2026年7月19日 · 19 分钟 · 3991 字 · 

nuPlan数据集详解

一、概述 nuPlan 是由 Motional(原 nuTonomy 团队)于 2023 年发布的大规模自动驾驶规划数据集与闭环仿真评测框架。与 nuScenes 主要聚焦感知任务不同,nuPlan 的设计初衷是填补规划领域三个核心空白:缺乏大规模人类驾驶规划数据、缺乏标准化闭环评测指标、以及缺乏可复现的仿真评估协议。 nuPlan 的核心规模数据:1500 小时的人类驾驶数据,覆盖全球四个城市——波士顿(Boston)、匹兹堡(Pittsburgh)、拉斯维加斯(Las Vegas)和新加坡(Singapore)。这些城市的驾驶环境具有显著差异:波士顿的老城区窄路与不规则交叉口、匹兹堡的丘陵道路与桥梁、拉斯维加斯的宽阔多车道网格化道路、新加坡的右舵驾驶与密集高架路网。 nuPlan 最革命性的贡献在于:它不仅是一个数据集,更是一个完整的闭环仿真平台。研究者可以在 nuPlan 仿真环境中部署自己的规划模型,与不同类型的交通参与者(log-replay 或 reactive agent)交互,并从安全性、合规性和通行效率等多个维度自动评估模型表现。这种"数据+仿真+评估"三位一体的设计,使 nuPlan 成为目前自动驾驶规划领域最全面的基准平台。 二、数据采集与统计 2.1 数据规模对比 维度 nuScenes nuPlan 总驾驶时长 约 5.5 小时 约 1500 小时 场景/Log 数 1000 个 scene 约 1282 个 log 标注关键帧 约 40,000 约 150 万 标注 3D 框总数 约 140 万 约 5900 万 覆盖城市 2(波士顿、新加坡) 4(波士顿、匹兹堡、拉斯维加斯、新加坡) 传感器配置 6 Cam + 5 Radar + 1 LiDAR 同 nuScenes(部分 Log 不同) 高精度地图 无 完整 HD Map(车道拓扑、交通标志) 仿真环境 无 内置闭环仿真器 2.2 四城市特点 波士顿:美国东北部老城,街道较窄且不规则,存在大量无保护左转、两阶段左转和环形交叉口。历史街区的道路拓扑复杂,行人活动频繁。冬季还可能遇到积雪和湿滑路面。波士顿的数据量约占全部数据的 30%。 ...

2026年7月19日 · 4 分钟 · 673 字 · AutoDriving Blog · 

nuScenes数据集详解

一、概述 nuScenes 是由 Aptiv(现 Motional)与 nuTonomy 团队于 2019 年发布的大规模自动驾驶多模态数据集,也是最早提供完整传感器套件标注的全场景数据集之一。它的发布标志着自动驾驶感知研究从单一传感器(仅 LiDAR 或仅 Camera)向多传感器融合的重要转折,极大地推动了 3D 检测、跟踪、预测和规划等多个方向的发展。 nuScenes 包含 1000 个驾驶场景(scene),每个场景时长约 20 秒,步长 20Hz 录制,关键帧以 2Hz 采样标注。数据采集覆盖波士顿和新加坡两个城市——包括城市主干道、居民区、十字路口、环形交叉口、隧道和高速公路等多种路况,以及白天、夜晚、黄昏、雨天等不同光照和天气条件。这种多样性使得基于 nuScenes 训练的模型对光照和天气变化具有更好的鲁棒性。 该数据集的核心价值在于其多模态特性:每辆数据采集车在同一时间戳下同时提供 6 个环视摄像头图像(覆盖 360° 视野)、5 个毫米波雷达点云和 1 个 32 线 Velodyne 激光雷达点云。研究者可以基于这些数据开发真正利用多模态传感器融合的感知算法,也可以分别验证不同传感器配置下算法的性能上限。 二、传感器配置 每一帧数据中,nuScenes 的传感器配置规格与部署位置如下: 2.1 传感器规格 摄像头(Camera):6 个环视摄像头,型号为 Basler ace acA1600-60gc(160 万像素),分别安装于车顶前部(CAM_FRONT)、左前(CAM_FRONT_LEFT)、右前(CAM_FRONT_RIGHT)、左侧(CAM_BACK_LEFT)、右侧(CAM_BACK_RIGHT)和后部(CAM_BACK)。每个摄像头输出 1600×900 像素 RGB 图像,帧率 12Hz,通过硬件同步实现同一时刻的全局快门采集。所有摄像头的水平视野之和覆盖 360°。 激光雷达(LiDAR):1 个 Velodyne HDL-32E 32 线旋转式激光雷达,安装于车顶中心位置,垂直视野范围 -30° 至 +10°(共 40°),水平视野 360°,帧率 20Hz。每帧返回约 80 万个点,波长 905nm,最大探测距离约 100m。点云密度随距离增加而减小,近距离(< 20m)密度最高。 ...

2026年7月19日 · 4 分钟 · 683 字 · AutoDriving Blog · 

Scaling Law与数据策略:训好大模型的工程法则

模型越大越好是一个粗糙的直觉,实际工程中需要在计算预算、数据配比、模型容量之间找到最优平衡。本文讲解scaling law的核心公式与迁移规律、数据混合配比的经验法则、训练曲线异常诊断、以及VLA模型训练中的数据预处理Pipeline与curriculum learning策略。

2026年7月19日 · 4 分钟 · 746 字 · 

车端C++开发实战:从Python原型到生产级代码

自动驾驶车端代码必须用C++满足实时性要求,但研究团队往往只有Python经验。本文梳理从PyTorch原型到车端C++部署的关键转换:TensorRT C++ API调用、CUDA kernel手写优化、内存管理策略、线程安全与锁设计、以及车端常见的IPC通信机制。

2026年7月19日 · 5 分钟 · 868 字 · 

端到端驾驶评测指标全景

一、引言 端到端自动驾驶模型的快速发展对评测体系提出了迫切需求。从早期的行为克隆论文仅报告 L2 位移误差,到如今 NAVSIM、nuPlan、Bench2Drive、CARLA 等多个基准各自定义复杂的复合指标,评测指标呈现出"从单一到综合、从开环到闭环、从粗粒度到细粒度"的演进趋势。 然而,指标选择本身也成为了一个需要深思熟虑的问题——不同的指标反应驾驶质量的不同侧面,单一指标往往存在偏差。理解每个指标的设计动机、计算细节和局限性,是做出可信研究的必要条件。 本文系统梳理端到端驾驶评测领域的主流指标,涵盖开环指标、闭环综合指标、按场景分解指标以及成功率等,并分析各指标之间的关联与互补关系。 二、开环评测指标 开环指标衡量模型预测轨迹与人类真值轨迹之间的差距,虽然不直接反映真实驾驶能力,但因其计算简单、可复现性强而被广泛使用。 2.1 L1/L2 位移误差 定义:在未来时刻 t(通常取 1.0s、2.0s、3.0s)上,预测位置与真值位置之间的距离。 公式: L A F 2 D D _ E E t = = = 1 | | / P P T _ _ ) p p r r × e e d d Σ ( ( _ T t t ) ) - - | P P P _ _ _ p g g r t t e ( ( d T t ( ) ) t | | | | ₂ ₂ - P _ g t ( t ) | | ₂ 解读:L2 误差越小越好,但存在显著的饱和效应——当误差降到一定程度后,进一步降低 L2 未必意味着更好的驾驶能力。更严重的问题是:L2 误差对轨迹的"合理性"完全不敏感,一个不安全的急刹车轨迹和一个安全的平稳减速轨迹可能有相同的 L2 误差。此外,L2 误差也无法区分横向偏差和纵向偏差——偏离车道 0.5 米和速度偏差 5 km/h 可能产生相同的 L2 值。 ...

2026年7月19日 · 5 分钟 · 882 字 · AutoDriving Blog · 

分布式训练的工程实践:从DeepSpeed到3D并行

大模型训练需要分布式系统支持,但3D并行(数据并行/张量并行/流水线并行)的配置与调优极为复杂。本文从单卡训练痛点出发,系统讲解DeepSpeed的ZeRO stages、Megatron-LM的张量切片策略、流水线并行的micro-batch调度,以及VLA模型训练中activation checkpointing与通信拓扑选择的工程经验。

2026年7月19日 · 4 分钟 · 836 字 · 

开环评测 vs 闭环评测深度解析

一、引言 在自动驾驶规划算法的研发流程中,评估方法的选择直接影响研究者对模型能力的判断。目前两类主流的评估范式——开环评测(Open-loop Evaluation)与闭环评测(Closed-loop Evaluation)——各有理论基础和适用范围,但二者之间存在显著的鸿沟。 NAVSIM 论文《Can We Also Drive in Closed-loop?》通过系统性实证研究揭示了这一鸿沟的严重程度:开环评测中的 L2 误差与闭环驾驶质量之间的 Pearson 相关系数仅约 0.3。这意味着一个在开环评测中排名第一的模型,在真实闭环部署中可能完全不合格。越来越多的研究者开始呼吁抛弃"开环迷信",转向更可靠的闭环评估或混合评估策略。 本文将从原理、方法、指标和实证分析四个维度,全面解析这两种评测范式,帮助研究者在论文写作和模型选择中做出更准确的判断。 二、开环评测 2.1 基本定义 开环评测的核心流程如下: 从已录制的驾驶数据集中取出一个片段 将历史观测数据(图像、点云、高精地图等)输入规划模型 模型输出未来一段时间的 EGO 预测轨迹 将预测轨迹与人类驾驶员在 log 中的实际轨迹(ground truth)进行比较 计算误差指标 关键特征在于:评测过程中,模型不会接收到自身决策的反馈。每一步的输入都来自真实 log 数据,与模型的预测无关。 2.2 数据流示意 t t t = = = 0 1 2 : : : 观 观 观 测 测 测 x x x ₀ ₁ ₂ → → → 模 模 模 型 型 型 → → → 预 预 预 测 测 测 ŷ ŷ ŷ ₀ ₁ ₂ ( ( x x ₁ ₂ 来 来 自 自 l l o o g g , , 与 与 ŷ ŷ ₀ ₀ 、 无 ŷ 关 ₁ ) 无 关 ) 这种"教师强制(Teacher Forcing)“模式下,模型的一步预测误差不会传播到下一步——每一步都是独立比较。 ...

2026年7月19日 · 4 分钟 · 655 字 · AutoDriving Blog ·