论文精读|ExploreVLA:密集世界建模与探索驱动的端到端自动驾驶

VLA 模型通过行为克隆学习驾驶策略,但受限于模仿学习无法探索专家分布之外的高质量策略。ExploreVLA 提出统一的理解-生成框架:用未来 RGB + 深度图生成作为密集世界建模目标,再利用世界模型的图像预测不确定性作为内在探索奖励,通过安全门控的 GRPO 优化策略。在 NAVSIM 上达到 93.7 PDMS 和 88.8 EPDMS。

2026年7月19日 · 5 分钟 · 946 字 · 

SimWAM 代码完整解读:从 Video DiT 到 Action DiT,从 SFT 到 FlowGRPO 的逐行拆解

从 configs/model/simwam_navsim.yaml 第 1 行开始,逐层追踪 SimWAM 的完整逻辑链:两个专家怎么协作?Isolated Attention Mask 怎么实现训练时借力、推理时独立?联合 Flow Matching 训练的损失怎么算?FlowGRPO 的 SDE 采样、PDM 奖励、LoRA 微调怎么串起来?每段代码都标注了源文件路径。

2026年9月6日 · 18 分钟 · 3703 字 · 

Flow-GRPO 完全讲解:训练/推理/梯度流/Loss 设计的逐行拆解

从 train_flux_fast.py 第 1 行开始,逐层追踪 Flow-GRPO 的完整逻辑链:采样阶段做了什么?reward 怎么变成 advantage?训练阶段的计算图是怎么构造的?loss 为什么那样设计?梯度如何从最后一个 log_prob 传到 LoRA 参数?每段代码都标注了源文件行号。

2026年7月30日 · 24 分钟 · 5063 字 · 

端到端自动驾驶模型架构全解:从感知到规划的六大范式与 80+ 模型逐篇拆解

一、为什么写这篇文章 本博客陆续精读了 100+ 篇自动驾驶与机器人模型论文——从感知基座(BEVFormer/Sparse4D),到显式端到端(UniAD/VAD/SparseDrive),到打分式(CLOVER/Hydra-MDP/GTRS),到扩散与 Flow 生成(DiffusionDrive/TransDiffuser/GoalFlow),再到 VLA 大模型(DriveVLM/EMMA/AutoVLA/LinkVLA)与世界模型(Cosmos/DriveFuture/WoTE)。单独看是逐篇精读,放在一起,端到端自动驾驶在 感知 → 预测 → 决策 → 规划 四个架构维度上的演进脉络其实非常清晰。 这篇文章把博客里所有精读过的模型收进同一个坐标系,回答三个问题: 感知:从稠密 BEV 到稀疏 query 再到纯视觉 token、几何寄存器,一路在换什么? 预测/决策/规划:从显式管线到打分排序、扩散生成、Flow 整流、LLM 推理、世界模型 roll-out,谁在取代谁?谁融合了谁? 谁真正有效:把彼此在 NAVSIM 上的 PDMS/EPDMS 分数和架构创新对照起来,看看分数到底来自技巧还是来自架构。 本文每个模型给"流派 → 核心创新 → 架构拆解(骨干/模块/输出/训练) → 代表分数“四个维度,尽量讲清楚架构;分数严格区分官方排行榜与 arXiv 自报,口径不一致处会注明。机器人侧的 VLA 模型(RT 系列、π0)作为同源背景单列一节——它们定义了「动作 token」「动作分块」「Flow 动作头」这三个被驾驶侧反复借用的组件。 二、先立坐标系:六大流派一张图 按「感知表征 × 规划输出方式」两个维度,我把博客里的方法归为六大流派: 流派 代表模型 核心思想 感知表征 规划输出 ① 显式端到端管线 UniAD、VAD、VADv2、SparseDrive、PARA-Drive、DriveTransformer、TransFuser 感知/预测/规划在同一个可训练网络里串起来 稠密 BEV / 稀疏 token / 寄存器 单条/多条轨迹回归 ② 评分排序式 (Scoring) CLOVER、Hydra-MDP、GTRS、SparseDriveV2、TOAD、GoalFlow 大量生成候选,再学打分器(或用搜索/流)选出最优 稀疏特征 / 轨迹词汇表 / 目标点 从候选集合中选 Top-1 ③ 扩散/Flow 生成式 DiffusionDrive、DiffusionPlanner、TransDiffuser、SafeDiffuser、FeaXDrive、Gen-Drive 把规划当成从噪声里生成(DDPM / Flow Matching / 整流流) 稀疏感知 / BEV / 图像 多模态轨迹生成 ④ VLA 大模型式 DriveVLM、EMMA、AutoVLA、LinkVLA、OneVL、LaST-VLA、WCog-VLA LLM/VLM 做感知+推理+决策,语言或 token 输出动作 视觉 token / 稀疏 query / 隐 token 语言决策 / 轨迹 token ⑤ 世界模型式 Cosmos、DriveFuture、WoTE、DreamerV3、DLWM、RAW2Drive、ReWorld 建模环境动力学/未来状态,以未来为条件或打分规划 隐潜 / 视频 token / BEV 未来帧 条件化/打分/rollout 规划 ⑥ 数据与评测基建 Bench2Drive、CARLA、K-Risk、MOSAIC、重卡数据集族 提供闭环基准、数据选择、仿真、安全分析 — — 一句话直觉:① 是"手拉手串行提线木偶”,② 是"多打几遍再挑",③ 是"从噪声里一遍遍画",④ 是"读得懂交规再动手",⑤ 是"先在脑内模拟未来再决定",⑥ 是"让前面所有流派有地方比"。六大流派不是互相淘汰,而是逐层叠加——今天最强的系统几乎都是 ②③⑤ 的混合。 ...

2026年8月10日 · 11 分钟 · 2231 字 · 

AlpaMayo-R1 代码讲解:VLM 说推理链、Expert 雕轨迹、一个模型两套头

零基础逐文件拆解 NVIDIA AlpaMayo-R1 推理源码:从 VLM/Expert/Diffusion 三组件架构到单轮动力学动作空间,从 Flow Matching 去噪到 Fourier 特征编码,用伪代码 + 大白话讲清这个 10B 参数的 VLA 模型是怎么从传感器数据一路「推理」到轨迹输出的。

2026年7月22日 · 16 分钟 · 3268 字 · 

AutoVLA 代码讲解:把「开车」变成「说动作 token」并用 GRPO 微调

「面向零基础读者逐行拆解 ucla-mobility/AutoVLA(NeurIPS 2025):从 VLA/动作 codebook/KMeans/快慢思考/SFT/GRPO 等概念讲起,配合论文架构图 + 自绘 SVG(整体架构、KMeans 聚类、两阶段训练流程),逐文件细讲 build_codebook 聚类、modeling_auto_vla 挂 action_head、LoRA 微调策略、SFT 数据模板设计、Stage-2 RFT 拒绝采样精修、推理旁路,最后给出个人思考与系列关系」

2026年7月20日 · 9 分钟 · 1729 字 · 

代码讲解:DiffusionDriveV2 — 用 GRPO 强化学习给截断扩散的多样轨迹「上安全锁」

「DiffusionDriveV2 在 DiffusionDrive 的 anchor 截断扩散之上,补了一套 GRPO 强化学习微调:用 scale-adaptive 乘性噪声做探索、Intra-Anchor GRPO 保住多模态不坍缩、Inter-Anchor Truncated GRPO 用碰撞惩罚把低质量轨迹压下去,最后加两级 Mode Selector 精排,在 NAVSIM v1 上冲到 91.2 PDMS。本文基于论文 Algorithm 还原成逐文件逐函数伪代码,从 cold start 权重加载写到 rollout → advantage → loss 的完整 RL 训练循环。」

2026年7月20日 · 15 分钟 · 3012 字 · 

论文精读:FeaXDrive — Feasibility-aware Trajectory-Centric Diffusion Planning

FeaXDrive 发现噪声中心扩散规划与轨迹可行性空间存在根本错位,提出轨迹中心扩散框架,通过自适应曲率正则化训练、可行驶区域引导推理和可行性感知 GRPO 后训练系统提升轨迹物理可行性。在 NAVSIM 上达 88.7 PDMS (IL) / 90.0 PDMS (RL),曲率违反率从 8.59% 降至 0.88%。

2026年7月19日 · 4 分钟 · 800 字 · 

论文精读|AutoDrive-P³:感知-预测-规划链式思维的统一强化微调——ICLR 2026 端到端驾驶新范式

当前 VLM 驾驶方案要么直接输出规划缺失 CoT 推理,要么将感知-预测-规划割裂为独立模块缺乏协同。AutoDrive-P³ 提出统一链式思维框架,通过 P³-CoT 数据集构建感知→预测→规划的结构化推理链,再用 P³-GRPO 算法进行分层渐进式强化微调——将奖励从规划反传到感知和预测模块,实现三模块联合优化。在 NAVSIM 上达到 89.9 EPDMS,nuScenes 上取得最低碰撞率。

2026年7月19日 · 5 分钟 · 951 字 ·