论文精读|PARA-Drive:完全并行的端到端架构,把感知预测规划"同时跑"

PARA-Drive 系统性地探索了端到端模块化自动驾驶的设计空间,提出完全并行的架构——感知、预测、规划模块同时训练、同时推理,互不依赖。在 nuScenes 上 L2 误差降低 28.8%、碰撞率降低 43.3%,推理速度提升近 3 倍,被 CVPR 2024 接收。

2026年7月30日 · 10 分钟 · 2003 字 · 

论文精读|VLA for Autonomous Driving:自动驾驶视觉-语言-动作模型的过去、现在与未来

这份 47 页的综述首次为自动驾驶 VLA 建立了系统形式化与分类法,从 VA(视觉-动作)到 VLA(视觉-语言-动作)理清演进线。它提出端到端 VLA 与双系统 VLA 两大范式分类,并统一梳理了动作空间四分法、数据集基准与评测协议。是当前自动驾驶 VLA 领域最权威的架构脉络地图和未来挑战指南。

2026年7月19日 · 6 分钟 · 1207 字 · 

论文精读|TruckV2X:首个以重卡为中心的 V2X 车路协同感知数据集,专治盲区与挂车遮挡

TruckV2X (IEEE RA-L 2025) 是首个以半挂重卡为中心的 V2X 多模态多智能体协同感知数据集,用 CARLA 仿真构建 64 个场景、88,396 帧点云、百万图像、118 万 3D 框,覆盖牵引车-挂车-CAV-RSU 四类智能体,系统性揭示重卡因车身长、挂车摆动、转弯内侧盲区而对车路协同的刚需。

2026年7月20日 · 4 分钟 · 755 字 · 

论文精读:DiffusionDriveV2 — RL-Constrained Truncated Diffusion

DiffusionDriveV2 将强化学习引入截断扩散模型,提出 Intra-Anchor GRPO 和 Inter-Anchor Truncated GRPO,解决了 DiffusionDrive 中多样性与一致高质量之间的根本矛盾。在 NAVSIM v1 上达到 91.2 PDMS,v2 上达到 85.5 EPDMS,均创下新纪录。

2026年7月19日 · 5 分钟 · 920 字 · 

论文精读|ACT + ALOHA:低成本双臂遥操作与动作分块策略

ACT+ALOHA 用不到 2 万美元的开源双臂遥操作平台解决了精细双臂操控的数据获取难题。ACT 采用动作分块(Action Chunking)+CVAE Transformer 的抗复合误差策略,将模仿学习精度推至新高度。ALOHA 的低成本同构主从机械臂设计为具身智能数据采集建立了新范式。

2026年7月19日 · 3 分钟 · 441 字 · 

论文精读:Longitudinal Safety Distance Control Considering Cargo Load(ICVES 2025)——RSS 安全距离模型为什么漏算了满载重卡的刹车

ICVES 2025 论文 Longitudinal Safety Distance Control Considering Cargo Load for Autonomous Heavy-Duty Vehicles 指出经典 RSS 安全距离模型假设车辆质量恒定,忽略了货物载荷,导致满载重卡制动距离更长、RSS 给出的安全距离不足而撞车。本文从 RSS 公式出发,讲清质量/载荷如何修正制动距离,并呼应博客 nuTruck 一文:现有 benchmark 不把质量/动力学安全作为指标。

2026年7月20日 · 5 分钟 · 1013 字 · 

RiskWorld 论文精读:以目标为中心的潜在世界模型,用于自动驾驶风险识别

北航 × 中关村实验室 RiskWorld 精读:不用「全局想象未来帧」,而是为每个周围目标单独跑一遍「如果它继续运动会怎样」的 RSSM 潜在动力学推演,从中解码出目标级风险评分。RiskBench 上 F1=63.0%、误报率仅 2.1%,在「谁是风险源」这个精准定位问题上超过了所有基线。

2026年9月7日 · 7 分钟 · 1436 字 · 

SimWAM 代码完整解读:从 Video DiT 到 Action DiT,从 SFT 到 FlowGRPO 的逐行拆解

从 configs/model/simwam_navsim.yaml 第 1 行开始,逐层追踪 SimWAM 的完整逻辑链:两个专家怎么协作?Isolated Attention Mask 怎么实现训练时借力、推理时独立?联合 Flow Matching 训练的损失怎么算?FlowGRPO 的 SDE 采样、PDM 奖励、LoRA 微调怎么串起来?每段代码都标注了源文件路径。

2026年9月6日 · 18 分钟 · 3703 字 · 

Flow-GRPO 完全讲解:训练/推理/梯度流/Loss 设计的逐行拆解

从 train_flux_fast.py 第 1 行开始,逐层追踪 Flow-GRPO 的完整逻辑链:采样阶段做了什么?reward 怎么变成 advantage?训练阶段的计算图是怎么构造的?loss 为什么那样设计?梯度如何从最后一个 log_prob 传到 LoRA 参数?每段代码都标注了源文件行号。

2026年7月30日 · 24 分钟 · 5063 字 · 

端到端自动驾驶模型架构全解:从感知到规划的六大范式与 80+ 模型逐篇拆解

一、为什么写这篇文章 本博客陆续精读了 100+ 篇自动驾驶与机器人模型论文——从感知基座(BEVFormer/Sparse4D),到显式端到端(UniAD/VAD/SparseDrive),到打分式(CLOVER/Hydra-MDP/GTRS),到扩散与 Flow 生成(DiffusionDrive/TransDiffuser/GoalFlow),再到 VLA 大模型(DriveVLM/EMMA/AutoVLA/LinkVLA)与世界模型(Cosmos/DriveFuture/WoTE)。单独看是逐篇精读,放在一起,端到端自动驾驶在 感知 → 预测 → 决策 → 规划 四个架构维度上的演进脉络其实非常清晰。 这篇文章把博客里所有精读过的模型收进同一个坐标系,回答三个问题: 感知:从稠密 BEV 到稀疏 query 再到纯视觉 token、几何寄存器,一路在换什么? 预测/决策/规划:从显式管线到打分排序、扩散生成、Flow 整流、LLM 推理、世界模型 roll-out,谁在取代谁?谁融合了谁? 谁真正有效:把彼此在 NAVSIM 上的 PDMS/EPDMS 分数和架构创新对照起来,看看分数到底来自技巧还是来自架构。 本文每个模型给"流派 → 核心创新 → 架构拆解(骨干/模块/输出/训练) → 代表分数“四个维度,尽量讲清楚架构;分数严格区分官方排行榜与 arXiv 自报,口径不一致处会注明。机器人侧的 VLA 模型(RT 系列、π0)作为同源背景单列一节——它们定义了「动作 token」「动作分块」「Flow 动作头」这三个被驾驶侧反复借用的组件。 二、先立坐标系:六大流派一张图 按「感知表征 × 规划输出方式」两个维度,我把博客里的方法归为六大流派: 流派 代表模型 核心思想 感知表征 规划输出 ① 显式端到端管线 UniAD、VAD、VADv2、SparseDrive、PARA-Drive、DriveTransformer、TransFuser 感知/预测/规划在同一个可训练网络里串起来 稠密 BEV / 稀疏 token / 寄存器 单条/多条轨迹回归 ② 评分排序式 (Scoring) CLOVER、Hydra-MDP、GTRS、SparseDriveV2、TOAD、GoalFlow 大量生成候选,再学打分器(或用搜索/流)选出最优 稀疏特征 / 轨迹词汇表 / 目标点 从候选集合中选 Top-1 ③ 扩散/Flow 生成式 DiffusionDrive、DiffusionPlanner、TransDiffuser、SafeDiffuser、FeaXDrive、Gen-Drive 把规划当成从噪声里生成(DDPM / Flow Matching / 整流流) 稀疏感知 / BEV / 图像 多模态轨迹生成 ④ VLA 大模型式 DriveVLM、EMMA、AutoVLA、LinkVLA、OneVL、LaST-VLA、WCog-VLA LLM/VLM 做感知+推理+决策,语言或 token 输出动作 视觉 token / 稀疏 query / 隐 token 语言决策 / 轨迹 token ⑤ 世界模型式 Cosmos、DriveFuture、WoTE、DreamerV3、DLWM、RAW2Drive、ReWorld 建模环境动力学/未来状态,以未来为条件或打分规划 隐潜 / 视频 token / BEV 未来帧 条件化/打分/rollout 规划 ⑥ 数据与评测基建 Bench2Drive、CARLA、K-Risk、MOSAIC、重卡数据集族 提供闭环基准、数据选择、仿真、安全分析 — — 一句话直觉:① 是"手拉手串行提线木偶”,② 是"多打几遍再挑",③ 是"从噪声里一遍遍画",④ 是"读得懂交规再动手",⑤ 是"先在脑内模拟未来再决定",⑥ 是"让前面所有流派有地方比"。六大流派不是互相淘汰,而是逐层叠加——今天最强的系统几乎都是 ②③⑤ 的混合。 ...

2026年8月10日 · 11 分钟 · 2231 字 · 

纯视觉端到端模型在 Cosmos 风格迁移加持下的 NAVSIM 大规模评测:11 个开源模型全景

0. 写在前面:我们需要一份"会晒黑的评测" 现阶段启用的 benchmark 大多默认天气晴朗、光照良好、纹理干净,视觉端到端模型的感知在这个"温室"里表现优秀。但当复用习惯了晴天的视觉 planner 进入真实世界——阴雨路面积水反光、雪天车道线被覆盖、黄昏光照死黑——它的 No-at-fault Collision 和 Drivable Area Compliance 往往断崖式下跌。“能不能开"和"换了个风格还能不能开"是两种能力。 课题组这一轮想做的,就是用 Cosmos(NVIDIA 的世界基础模型)做光照/天气/纹理的风格迁移(rain / snow / 日夜 / 模糊),在不改变场景拓扑、导航指令和 agents 语义的前提下,把同一份 NAV 场景"换皮”,得到一组视觉域被扰动、但语义标签不变的评测集,然后再跑纯视觉 end-to-end 模型在 NAV 上的 PDMS。这样我们拿到的不只是一个数字,而是一张"模型在位姿、外观扰动下的鲁棒性画像",可以回答:哪个模型在风格漂移下最硬?哪个只在晴天强? 0.1 选型逻辑:为什么是这 11 个 入选标准明确,缺一不可: camera-only(纯视觉):必须只吃相机输入,不能依赖 LiDAR 点云。这样"风格迁移只改图像"才能干净地、真实地作用到模型输入上。 NAV 可跑:官方有 NAV 相关权重或可复现配置,能进入我们的批量评测管线(Agent API 封装)。 论文开源:能从 arXiv 拿到原文架构与打分细节。 覆盖技术谱系:从规则化生成型(LTF)到高分辨率稀疏语义 (SparseDriveV2)、proposal 中心式(iPad)、扩散/飞流式(DrivoR、Drive-JEPA、DriveLaW)、再到 VLA 语言世界模型(ChainFlow-VLA、AutoVLA、ReCogDrive、DriveVLA-W0)——我们想测的是"在哪一种范式上,风格迁移造成的伤害最小"。 于是,最终敲定了下面 11 个:SparseDriveV2、iPad、DrivoR、ChainFlow-VLA、AutoVLA、ReCogDrive、DriveVLA-W0、Drive-JEPA、DriveSuprim、DriveLaW、LTF(Latent TransFuser)。 下面我会给每个模型:一句话定位 → 架构解读(附 arXiv 原文架构图)→ 官方资源(仓库/HF)→ 评测配置 → NAV 得分 → 在我们风格迁移评测里值得画的重点。 ...

2026年8月7日 · 5 分钟 · 1029 字 · 

Cosmos 3 代码讲解:Mixture-of-Transformers 双塔统一五模态世界模型

「NVIDIA Cosmos 3 用 Mixture-of-Transformers 双塔架构把语言、图像、视频、音频、动作五模态统一进一个世界基础模型。本文从 NVIDIA/cosmos-framework 源码出发,面向零基础读者逐文件讲透 MoT 双塔(PackedAttentionMoT / MoTDecoderLayer 的 dual-QKV/proj 设计)、DCAE 视频 tokenizer(4×32×32 因果 VAE)、Rectified Flow 训练(logit-normal 时间分布 + MSE 向量场损失)、序列打包(und/gen token 混排)、以及推理管线(35 步 UniPC 调度 + 多模态生成),最后与 pi0 / Diffusion Planner / AlpaMayo-R1 对照」

2026年7月29日 · 19 分钟 · 3921 字 · 

Cosmos-3 + MoE + Flow-GRPO 架构概览

本文提出一种将 Cosmos-3 双塔 MoT、DeepSeek-style Sparse MoE、Flow Matching 与 Flow-GRPO 结合的架构设计方案,系统描述各模块的角色、接口与训练推理流程。

2026年7月23日 · 2 分钟 · 412 字 · 

思考|重卡 VLA 是一个巨大的研究空白——兼论 Truck-VLA 架构设计

引言:100 篇 VLA 论文,0 篇属于重卡 如果你关注自动驾驶领域的最新进展,一定注意到 2024-2026 年间 VLA(Vision-Language-Action)模型的爆发式增长。从 AutoVLA、DriveVLM、EMMA、OpenDriveVLA 到 SAMoE-VLA、LaST-VLA、UniDriveVLA,光是 arXiv 上能找到的自动驾驶 VLA 论文就已超过 100 篇。 但这里有一个令人震惊的事实: 这 100+ 篇论文,没有一篇专门针对重卡(heavy-duty truck)场景。 所有模型都在乘用车数据集(nuScenes、Waymo Open Dataset、Bench2Drive、CARLA)上训练和评测。 与此同时,重卡自动驾驶的产业化进程正在加速:Aurora 于 2025 年在德州启动了无安全员的 L4 商业运营,Kodiak AI 已将 VLM 部署在自家卡车感知栈上,Torc Robotics 计划 2027 年量产 L4 卡车。重卡自动驾驶的市场需求是真实且急迫的——美国卡车运输业每年承担着超过 7000 亿美元的货物运输,卡车司机缺口超过 10 万人。然而学术界对重卡 VLA 的研究仍然是一片空白。这不仅是学术上的缺憾,更是产业落地的关键瓶颈。 本文的目标是: 定义这个空白:为什么现有 VLA 方法不能直接迁移到重卡? 分析根本原因:哪些维度造成了迁移障碍? 提出架构方案:Truck-VLA 应该怎么设计? 给出路线图:从哪里开始填补这个空白? 一、VLA 简史:从 VA 到 VLA 的演进 在深入重卡之前,先回顾一下自动驾驶 VLA 的整体图景。 1.1 三个时代 自动驾驶的"感知-决策-控制"管线经历了三个阶段: VA 时代(2016-2023):视觉-动作模型,直接从传感器映射到控制输出。代表工作包括 ALVINN、ChauffeurNet、TransFuser、UniAD、VAD。核心局限是黑盒推理、长尾泛化差、无法理解语言指令。这一时期的模型本质上是"感知→轨迹"的纯回归映射,缺乏显式推理能力。 ...

2026年7月23日 · 12 分钟 · 2451 字 · 

AlpaMayo-R1 代码讲解:VLM 说推理链、Expert 雕轨迹、一个模型两套头

零基础逐文件拆解 NVIDIA AlpaMayo-R1 推理源码:从 VLM/Expert/Diffusion 三组件架构到单轮动力学动作空间,从 Flow Matching 去噪到 Fourier 特征编码,用伪代码 + 大白话讲清这个 10B 参数的 VLA 模型是怎么从传感器数据一路「推理」到轨迹输出的。

2026年7月22日 · 16 分钟 · 3268 字 · 

论文精读|TransDiffuser:去相关多模态表示驱动的扩散式轨迹生成

LiAuto 提出 TransDiffuser,用多模态表示去相关(Decorrelation)解决扩散轨迹生成中的模式坍缩问题。核心思路是强制多模态条件特征的维度去相关,让条件信号更丰富地覆盖潜空间,从而无需任何锚点轨迹或场景先验即可生成多样化轨迹。ResNet-34 + LiDAR 配置在 NAVSIM 上达到 PDMS 94.85。本文将用一张图一张图对应讲解的方式,把这篇论文的动机、架构、核心创新全部讲清楚。

2026年7月22日 · 5 分钟 · 968 字 · 

如何在NAVSIM刷到PDMS 90分以上

引言 NAVSIM 排行榜的竞争已经到了白热化阶段。从最初的 80 分出头到现在的 94.5 分(CLOVER),短短两年时间,顶尖方案的 PDMS 提升了 15 个点。如果你正在读这篇文章,大概率是两种人:一是想在排行榜上刷个高分的选手,二是研究自动驾驶规划、想理解 Scoring-based 范式演进方向的研究者。 这篇文章不讲虚的,直接切入正题:到底怎么才能在 NAVSIM 上把 PDMS 刷到 90 分? 我会结合 NAVSIM 排行榜上所有公开的高分方案(CLOVER、CLEAR、DriveFuture、Hydra-MDP 以及各种 VLA + RL 方案),从 PDMS 公式的数学结构出发,逐层拆解每个分数段的瓶颈和对应的策略。 先给个核心结论:PDMS 90+ 的秘密不在于模型多强大,而在于你是否真正理解了 Scoring 范式的每个环节。 一、PDMS 公式:分数结构决定了优化策略 如果你还不知道 PDMS 怎么算的,那先把这块搞清楚。分数结构本身就在告诉你该优化什么。 PDMS 公式拆解 1.1 公式结构 记住这个公式: PDMS = NC × DAC × (5·EP + 5·TTC + 2·C) / 12 这里最应该引起你注意的是乘性结构:NC 和 DAC 是乘法项,意味着任何一个为零,整体分数直接归零。这不是简单的加减法,这是一个"安全第一,前进第二"的奖励结构。 加性部分是 (5·EP + 5·TTC + 2·C) / 12,EP 和 TTC 各占 5 份权重,C 只占 2 份。 ...

2026年7月22日 · 11 分钟 · 2327 字 · 

AutoVLA 代码讲解:把「开车」变成「说动作 token」并用 GRPO 微调

「面向零基础读者逐行拆解 ucla-mobility/AutoVLA(NeurIPS 2025):从 VLA/动作 codebook/KMeans/快慢思考/SFT/GRPO 等概念讲起,配合论文架构图 + 自绘 SVG(整体架构、KMeans 聚类、两阶段训练流程),逐文件细讲 build_codebook 聚类、modeling_auto_vla 挂 action_head、LoRA 微调策略、SFT 数据模板设计、Stage-2 RFT 拒绝采样精修、推理旁路,最后给出个人思考与系列关系」

2026年7月20日 · 9 分钟 · 1729 字 · 

Diffusion Planner 代码讲解:轨迹级扩散 + 免训练能量引导

「Diffusion Planner 把规划对象从『动作』升级为『整条轨迹』,用 DiT + MLP-Mixer 去噪;亮点是在 DDPM 采样时注入 classifier guidance(碰撞/可行驶区域/运动学能量),无需重新训练就能把轨迹压进可行域,本文顺着官方仓库从名词、架构、逐文件逐函数一直讲到多模态闭环评测,帮零基础读者把『轨迹级扩散 + 免训练能量引导』这条主线彻底打通」

2026年7月20日 · 8 分钟 · 1524 字 · 

Diffusion Policy 代码讲解:用 DDPM 给机器人「生成」一连串动作

「Diffusion Policy 把『给一段观察、出一段动作序列』做成条件扩散生成:噪声动作被 ConditionalUnet1D 逐步去噪,训练是 DDPM 标准损失(预测加到数据上的噪声、MSE),推理是 DDIM 多步采样(20~100 步),归一化必做且推理要 unnormalize 回真实量纲。本文顺着 real-stanford 官方仓库,从名词速查、架构总览、项目结构,到 ConditionalUnet1D / diffusion / diffusion_unet1d_policy / base_dataset / train_diffusion_policy 逐文件逐函数细讲,并穿插『为什么多步动作更稳、为什么扩散天然多模态、为什么归一化是命门』等认知,最后落到它作为 DiffusionDrive / Diffusion Planner / pi0 方法论母体的位置,是一篇面向零基础、超详细、篇幅足够长的工程向代码讲解」

2026年7月20日 · 10 分钟 · 2044 字 ·