技术博客

自动驾驶 VLA · 世界模型 · 端到端 · 前沿论文精读与知识分享

📅 2026
SEP 07
RiskWorld 论文精读:以目标为中心的潜在世界模型,用于自动驾驶风险识别
北航 × 中关村实验室 RiskWorld 精读:不用「全局想象未来帧」,而是为每个周围目标单独跑一遍「如果它继续运动会怎样」的 RSSM 潜在动力学推演,从中解码出目标级风险评分。RiskBench 上 F1=63.0%、误报率仅 2.1%,在「谁是风险源」这个精准定位问题上超过了所有基线。
RiskWorld Risk Identification World Model RSSM 自动驾驶
SEP 06
SimWAM 代码完整解读:从 Video DiT 到 Action DiT,从 SFT 到 FlowGRPO 的逐行拆解
从 configs/model/simwam_navsim.yaml 第 1 行开始,逐层追踪 SimWAM 的完整逻辑链:两个专家怎么协作?Isolated Attention Mask 怎么实现训练时借力、推理时独立?联合 Flow Matching 训练的损失怎么算?FlowGRPO 的 SDE 采样、PDM 奖励、LoRA 微调怎么串起来?每段代码都标注了源文件路径。
SimWAM World Action Model Flow Matching GRPO Wan2.2
SEP 06
论文精读|Qwen-Drive-1.0:阿里通义首个驾驶视觉-语言基础模型
Qwen-Drive-1.0 基于 Qwen3.5-4B VLM 外挂两个模块:BEV感知头(3D检测+占用预测+地图分割)和 Planning Expert(~1.1B 参数 Flow Matching 轨迹生成器),四阶段渐进训练。关键设计:**不设推理时打分器**,直接用 Flow Matching 单次采样输出轨迹,RL 后训练用 GRPO 式分组优势优化。NAVSIM v1.1 榜上 90.7 PDMS(RL),WOD-E2E 7.91 RFS,AlpaSim 闭环 0.37 分。
🧠 VLA 🏭 阿里 🚗 自动驾驶 ⚡ Flow Matching 🔄 RL后训练
AUG 19
论文精读|BrainWAM:大脑式'动作空间协调'——把 VLA 语义先验和 WAM 预测动态拧成一股绳
BrainWAM 用'大脑分工'的思路回答一个根本问题:VLA(语义推理)和 WAM(预测动态)到底该怎么结合?它先诊断出 Tri-MoT 朴素融合的致命伤——语义 token 抢占注意力、压垮预测信号;再受左右脑半球经胼胝体通信、小脑协调运动意图的启发,把语义和预测拆成两条特化通路,各自产出'面向动作'的表示,最后在紧凑的动作空间里用 CAB(胼胝体动作桥)双向交换、CIF(小脑意图融合)协调解码。NAVSIM v1 拿到 89.5 PDMS、v2 拿到 89.6 EPDMS,双双超过 VLA-only、WAM-only 和 Tri-MoT。
🌍 世界模型 🌊 Flow Matching 🧠 VLA 🚗 自动驾驶 🔀 多模态融合
AUG 19
论文精读|Percept-WAM:把 2D/3D 感知'种'进 VLM 里的感知增强世界动作模型
Percept-WAM 回答的是 WAM 系列的另一个致命问题:VLM 的空间感太差——'定位漂移、时序不一致、置信度虚高',导致 VLA 系统的感知和规划都不稳。它把 2D/3D 感知任务直接'种'进单个 VLM 里:用 World-PV token(透视视角)和 World-BEV token(鸟瞰视角)编码可定位的世界状态,配合网格条件化预测头、IoU 校准置信度和并行自回归解码,再用四组点级 query(Q_pv/Q_bev/Q_ego/Q_full)把感知表示对齐成轨迹。NAVSIM v1 拿到 90.2 PDMS,超过 DiffusionDrive 2.1,还配了流式推理把时延压到 707ms。
🌍 世界模型 🧠 VLA 🚗 自动驾驶 👁️ 感知 🔀 多模态融合
AUG 19
论文精读|DriveVLA-M0:失败感知的记忆增强,让 VLA 学会吃一堑长一智
DriveVLA-M0 给 VLA 自动驾驶加上了'失败记忆':离线把模型表现差的场景连同路网/交互结构特征写进 latent memory,在线用专用的 Retrieve Model 检索结构相似的失败案例,再用解耦 LoRA 做测试时训练(TTT)逐场景纠正,让模型'吃一堑长一智'。NAVSIMv1 上 94.1 PDMS、NAVSIMv2 上 47.0 EPDMS,TTT 后向开销仅 26.44ms。它与同系 DriveVLA-W0 走了完全相反的路:W0 用世界模型换'稠密监督',M0 用失败记忆换'场景自适应'。
🧠 VLA 🗄️ 记忆增强 🔄 测试时训练 🚗 自动驾驶 🧬 LoRA
AUG 17
论文精读|SimWAM:把世界模型当'训练老师',用 Flow-GRPO 让 Action Expert 学会'自己开车'
SimWAM 用 joint flow matching 把预训练视频专家的交通动态先验'蒸馏'进轻量级 Action Expert,再用隔离注意力掩码让动作分支彻底摆脱未来帧依赖;随后把确定性 Flow ODE 转成可探索的 SDE,用 GRPO 直接优化 NAVSIM 组合驾驶奖励,突破模仿学习的上限。91.5 PDMS 新 SOTA,推理时延大幅低于 imagine-then-act 的 WAM,并零样本迁移到 nuScenes。
🌊 Flow Matching 🎮 强化学习 ⚡ GRPO 🌍 世界模型 🚗 自动驾驶
AUG 17
论文精读|Metis:用'非对称注意力掩码'把视频生成与动作预测解耦的世界动作模型
Metis 用 Mixture-of-Transformers 把'视频生成专家'和'动作预测专家'拆成两个独立 Transformer,再用一张非对称注意力掩码管理二者的信息流:动作只看向当前帧,未来视频可以看动作。训练时联合优化两者学到世界动态,推理时直接跳过视频生成只跑动作分支——NAVSIM-v2 navhard/navtest 和 CityWalker 全面 SOTA,纯动作推理比带视频快 8 倍,还零样本部署到四足机器人。
🌍 世界模型 🌊 Flow Matching 🚗 自动驾驶 🤖 具身导航 🔄 Mixture-of-Transformers
AUG 10
端到端自动驾驶模型架构全解:从感知到规划的六大范式与 80+ 模型逐篇拆解
一、为什么写这篇文章 本博客陆续精读了 100+ 篇自动驾驶与机器人模型论文——从感知基座(BEVFormer/Sparse4D),到显式端到端(UniAD/VAD/SparseDrive),到打分式(CLOVER/Hydra-MDP/GTRS),到扩散与 Flow 生成(DiffusionDrive/TransDiffuser/GoalFlow),再到 VLA 大模型(DriveVLM/EMMA/AutoVLA/LinkVLA)与世界模型(Cosmos/DriveFuture/WoTE)。单独看是逐篇精读,放在一起,端到端自动驾驶在 感知 → 预测 → 决策 → 规划 四个架构维度上的演进脉络其实非常清晰。 这篇文章把博客里所有精读过的模型收进同一个坐标系,回答三个问题: 感知:从稠密 BEV 到稀疏 query 再到纯视觉 token、几何寄存器,一路在换什么? 预测/决策/规划:从显式管线到打分排序、扩散生成、Flow 整流、LLM 推理、世界模型 roll-out,谁在取代谁?谁融合了谁? 谁真正有效:把彼此在 NAVSIM 上的 PDMS/EPDMS 分数和架构创新对照起来,看看分数到底来自技巧还是来自架构。 本文每个模型给"流派 → 核心创新 → 架构拆解(骨干/模块/输出/训练) → 代表分数“四个维度,尽量讲清楚架构;分数严格区分官方排行榜与 arXiv 自报,口径不一致处会注明。机器人侧的 VLA 模型(RT 系列、π0)作为同源背景单列一节——它们定义了「动作 token」「动作分块」「Flow 动作头」这三个被驾驶侧反复借用的组件。 二、先立坐标系:六大流派一张图 按「感知表征 × 规划输出方式」两个维度,我把博客里的方法归为六大流派: 流派 代表模型 核心思想 感知表征 规划输出 ① 显式端到端管线 UniAD、VAD、VADv2、SparseDrive、PARA-Drive、DriveTransformer、TransFuser 感知/预测/规划在同一个可训练网络里串起来 稠密 BEV / 稀疏 token / 寄存器 单条/多条轨迹回归 ② 评分排序式 (Scoring) CLOVER、Hydra-MDP、GTRS、SparseDriveV2、TOAD、GoalFlow 大量生成候选,再学打分器(或用搜索/流)选出最优 稀疏特征 / 轨迹词汇表 / 目标点 从候选集合中选 Top-1 ③ 扩散/Flow 生成式 DiffusionDrive、DiffusionPlanner、TransDiffuser、SafeDiffuser、FeaXDrive、Gen-Drive 把规划当成从噪声里生成(DDPM / Flow Matching / 整流流) 稀疏感知 / BEV / 图像 多模态轨迹生成 ④ VLA 大模型式 DriveVLM、EMMA、AutoVLA、LinkVLA、OneVL、LaST-VLA、WCog-VLA LLM/VLM 做感知+推理+决策,语言或 token 输出动作 视觉 token / 稀疏 query / 隐 token 语言决策 / 轨迹 token ⑤ 世界模型式 Cosmos、DriveFuture、WoTE、DreamerV3、DLWM、RAW2Drive、ReWorld 建模环境动力学/未来状态,以未来为条件或打分规划 隐潜 / 视频 token / BEV 未来帧 条件化/打分/rollout 规划 ⑥ 数据与评测基建 Bench2Drive、CARLA、K-Risk、MOSAIC、重卡数据集族 提供闭环基准、数据选择、仿真、安全分析 — — 一句话直觉:① 是"手拉手串行提线木偶”,② 是"多打几遍再挑",③ 是"从噪声里一遍遍画",④ 是"读得懂交规再动手",⑤ 是"先在脑内模拟未来再决定",⑥ 是"让前面所有流派有地方比"。六大流派不是互相淘汰,而是逐层叠加——今天最强的系统几乎都是 ②③⑤ 的混合。
端到端自动驾驶 UniAD VAD SparseDrive DiffusionDrive
AUG 07
纯视觉端到端模型在 Cosmos 风格迁移加持下的 NAVSIM 大规模评测:11 个开源模型全景
0. 写在前面:我们需要一份"会晒黑的评测" 现阶段启用的 benchmark 大多默认天气晴朗、光照良好、纹理干净,视觉端到端模型的感知在这个"温室"里表现优秀。但当复用习惯了晴天的视觉 planner 进入真实世界——阴雨路面积水反光、雪天车道线被覆盖、黄昏光照死黑——它的 No-at-fault Collision 和 Drivable Area Compliance 往往断崖式下跌。“能不能开"和"换了个风格还能不能开"是两种能力。 课题组这一轮想做的,就是用 Cosmos(NVIDIA 的世界基础模型)做光照/天气/纹理的风格迁移(rain / snow / 日夜 / 模糊),在不改变场景拓扑、导航指令和 agents 语义的前提下,把同一份 NAV 场景"换皮”,得到一组视觉域被扰动、但语义标签不变的评测集,然后再跑纯视觉 end-to-end 模型在 NAV 上的 PDMS。这样我们拿到的不只是一个数字,而是一张"模型在位姿、外观扰动下的鲁棒性画像",可以回答:哪个模型在风格漂移下最硬?哪个只在晴天强? 0.1 选型逻辑:为什么是这 11 个 入选标准明确,缺一不可: camera-only(纯视觉):必须只吃相机输入,不能依赖 LiDAR 点云。这样"风格迁移只改图像"才能干净地、真实地作用到模型输入上。 NAV 可跑:官方有 NAV 相关权重或可复现配置,能进入我们的批量评测管线(Agent API 封装)。 论文开源:能从 arXiv 拿到原文架构与打分细节。 覆盖技术谱系:从规则化生成型(LTF)到高分辨率稀疏语义 (SparseDriveV2)、proposal 中心式(iPad)、扩散/飞流式(DrivoR、Drive-JEPA、DriveLaW)、再到 VLA 语言世界模型(ChainFlow-VLA、AutoVLA、ReCogDrive、DriveVLA-W0)——我们想测的是"在哪一种范式上,风格迁移造成的伤害最小"。 于是,最终敲定了下面 11 个:SparseDriveV2、iPad、DrivoR、ChainFlow-VLA、AutoVLA、ReCogDrive、DriveVLA-W0、Drive-JEPA、DriveSuprim、DriveLaW、LTF(Latent TransFuser)。 下面我会给每个模型:一句话定位 → 架构解读(附 arXiv 原文架构图)→ 官方资源(仓库/HF)→ 评测配置 → NAV 得分 → 在我们风格迁移评测里值得画的重点。
NAVSIM 端到端规划 纯视觉 Cosmos 风格迁移
AUG 05
自动驾驶优质博客收藏夹|随手存,少逛,逛精
把平时刷到的优秀自动驾驶博客/资源链接集中存到这里,避免日后找不到。主打一个'少逛、逛精'——每篇能持续产出高质量内容才放进收藏。持续更新。
📌 收藏夹 🚗 自动驾驶 🔗 博客链接 📚 学习资源
AUG 05
自动驾驶学习路径总目录|用我的论文精读串成的金字塔地图
参考'少读要比乱读强'的思路,把我论文精读区的文章按'地基→BEV感知→端到端→世界模型→扩散+强化学习→VLA'六层金字塔组织起来。顺着层往上走,每层解决上一层留下的问题,最后落在 VLA/世界模型这些前沿范式上。这是本站论文精读的总入口。
🗺️ 学习路径 🚗 自动驾驶 📚 论文精读 📐 目录
JUL 30
Flow-GRPO 完全讲解:训练/推理/梯度流/Loss 设计的逐行拆解
从 train_flux_fast.py 第 1 行开始,逐层追踪 Flow-GRPO 的完整逻辑链:采样阶段做了什么?reward 怎么变成 advantage?训练阶段的计算图是怎么构造的?loss 为什么那样设计?梯度如何从最后一个 log_prob 传到 LoRA 参数?每段代码都标注了源文件行号。
Flow Matching GRPO 强化学习 扩散模型 Flux
JUL 30
论文精读|PARA-Drive:完全并行的端到端架构,把感知预测规划"同时跑"
PARA-Drive 系统性地探索了端到端模块化自动驾驶的设计空间,提出完全并行的架构——感知、预测、规划模块同时训练、同时推理,互不依赖。在 nuScenes 上 L2 误差降低 28.8%、碰撞率降低 43.3%,推理速度提升近 3 倍,被 CVPR 2024 接收。
🔗 端到端 ⚡ 并行架构 🧠 设计空间探索 🚗 自动驾驶 🏆 CVPR 2024
JUL 30
论文精读|TransFuser:用 Transformer 做传感器融合——让相机和激光雷达"商量着开车"
TransFuser 在 CARLA 上首次验证了 Transformer 做多模态传感器融合的可行性——用自注意力让图像和 LiDAR 特征在多个分辨率上密集交互,取代简单的几何融合。在 CARLA Leaderboard 和 Longest6 基准上以显著优势领先此前所有方法,将碰撞率降低 48%。
🔗 端到端 🤖 传感器融合 🧠 Transformer 🚗 自动驾驶 👁️ 视觉
JUL 30
论文精读|DriveTransformer:统一Transformer——告别BEV,拥抱稀疏Token并行交互
DriveTransformer 彻底抛弃了 BEV 表示——不再构建稠密 BEV 特征,而是让任务 query 直接与原始传感器特征交互。三种注意力(Sensor Cross-Attention、Task Self-Attention、Temporal Cross-Attention)构成统一框架,支持单阶段端到端训练。在 Bench2Drive 闭环评测中以 63.46 Driving Score 大幅超越 UniAD(45.81)和 VAD(42.35),且在鲁棒性上碾压 BEV 方案。获 ICLR 2025 接收。
🔗 端到端 🏆 ICLR 2025 ⚡ 稀疏表示 🔀 并行架构 🚗 自动驾驶
JUL 30
损失函数完全指南:从 L1 到 GRPO——端到端自动驾驶中的 Loss 设计哲学
读论文时被各种 Loss 搞晕了?L1、L2、Focal、KL 散度、碰撞 Loss、GRPO……为什么同一个任务在不同文章里用的 Loss 不一样?这篇文章帮你把端到端自动驾驶里的所有损失函数理清楚——每种 Loss 的数学形式、直觉理解、适用场景,以及它们之间的演进关系。
📉 Loss 🔧 工程实践 🧠 深度学习 🚗 自动驾驶
JUL 29
Cosmos 3 代码讲解:Mixture-of-Transformers 双塔统一五模态世界模型
「NVIDIA Cosmos 3 用 Mixture-of-Transformers 双塔架构把语言、图像、视频、音频、动作五模态统一进一个世界基础模型。本文从 NVIDIA/cosmos-framework 源码出发,面向零基础读者逐文件讲透 MoT 双塔(PackedAttentionMoT / MoTDecoderLayer 的 dual-QKV/proj 设计)、DCAE 视频 tokenizer(4×32×32 因果 VAE)、Rectified Flow 训练(logit-normal 时间分布 + MSE 向量场损失)、序列打包(und/gen token 混排)、以及推理管线(35 步 UniPC 调度 + 多模态生成),最后与 pi0 / Diffusion Planner / AlpaMayo-R1 对照」
世界模型 NVIDIA MoT Cosmos3 代码讲解
JUL 29
论文精读|DrivoR: Driving on Registers — 基于寄存器token的高效端到端自动驾驶
DrivoR提出了一种极简的纯Transformer端到端自动驾驶架构,利用ViT寄存器token将多相机视觉特征压缩为紧凑场景表示,仅需~40M参数即可在NAVSIM和HUGSIM上达到SOTA。
🚗 端到端自动驾驶 ⚡ ViT寄存器 🧠 Token压缩 📊 CVPR 2026
JUL 29
论文精读|iPad: Iterative Proposal-centric End-to-End Autonomous Driving
iPad提出了一种以轨迹提案为中心的端到端自动驾驶框架,通过ProFormer迭代式精炼稀疏BEV提案,替代了传统的密集BEV网格范式,在NAVSIM和Bench2Drive上达到SOTA且计算效率提高10倍以上。
🚗 端到端自动驾驶 ⚡ 迭代规划 🧠 稀疏Proposal 📊 CVPR 2025