技术博客
自动驾驶 VLA · 世界模型 · 端到端 · 前沿论文精读与知识分享
📅 2026
JUL
20
论文精读|Anti-rollover APF — 用五自由度动力学 + 侧翻排斥势场,让重卡规划阶段就避开翻车
本文精读 Jin 与 He 在 2024 年 Chinese Journal of Mechanical Engineering 发表的 Anti-rollover Artificial Potential Field Motion Planning Method of an Autonomous Heavy Truck Optimised by Game Theory。论文用 5-DOF 重卡动力学模型推导侧翻指标,提出把侧翻排斥势场(anti-rollover APF)融入 MPC 运动规划,并用博弈论优化势场权重,让重卡在规划阶段就同时兼顾避障与防侧翻。面向刚入行的 VLA 工程师,用大白话讲清侧翻机理、LTR 判据、五自由度模型与势场规划框架,并呼应博客 nuTruck 文章。
JUL
20
论文精读:WoTE — 用 BEV 世界模型做在线轨迹评估的端到端驾驶
WoTE(ICCV 2025, CASIA)指出:端到端规划器只生成轨迹却「盲目」选轨迹,缺少对未来后果的预判。它用一个 BEV 空间世界模型,给每条候选轨迹 rollout 出未来 BEV 状态,再由奖励模型打分挑最高奖励者。BEV 空间比图像级世界模型省算力,且能直接用 nuPlan 等 BEV 仿真器提供监督。NAVISIM 达 88.3 PDMS,Bench2Drive 闭环 Driving Score 61.71 创 SOTA。
JUL
20
论文精读:GTRS — 通用轨迹评分(CVPR25 自动驾驶挑战赛冠军)
GTRS(NVIDIA, CVPR 2025 自动驾驶挑战赛 E2E 赛道冠军)指出:现有轨迹评分器要么打「静态大词表」要么打「动态小候选」,两者都泛化差。GTRS 用三根支柱统一二者:(1) 扩散策略生成细粒度动态候选;(2) 在 16384 的超密集词表上训练评分器 + 词表 dropout,使推理时能在更小子集上强泛化;(3) 传感器旋转增强 + top-k 细化自蒸馏,提升域外鲁棒性。Navhard 榜 EPDMS 最高 49.4,逼近依赖真值感知的 PDM-Closed。
JUL
20
论文精读:Drive-JEPA — Video JEPA 预训练 + 多模态轨迹蒸馏的端到端驾驶
Drive-JEPA(2026)指出端到端驾驶的两个瓶颈:(1) 视频世界模型预训练收益有限;(2) 每场景只有一条人类轨迹,多模态监督稀缺。它用 V-JEPA(而非生成式世界模型)在 208 小时驾驶视频上自监督预训练 ViT 编码器,得到规划对齐的表征;再用基于仿真器的「多模态轨迹蒸馏」把多样伪教师轨迹蒸馏进 proposal-centric 规划器,并以动量感知选择抑制帧间抖动。NAVISIM v1 达 93.3 PDMS、v2 达 87.8 EPDMS 双榜 SOTA,仅前视相机+轻量 transformer 即在无感知设定下超此前 SOTA 3 PDMS。
JUL
20
代码讲解:SparseDriveV2 因子化轨迹词汇表与两级评分的完整闭环
逐行拆解 swc-17/SparseDriveV2 的真实源码:从架构图与全局数据流出发,用最通俗的大白话讲清几何路径乘以速度剖面如何因子化组合成 26 万条轨迹词汇表、两级评分怎么把候选从 26 万粗筛到 200 条再精排、PDM score 蒸馏损失如何用排行榜判分器当老师。一篇把项目挂载方式、数据流、前向传播、训练梯度、推理选轨迹、个人思考全部讲透、面向零基础读者的工程向代码讲解。
JUL
20
代码讲解:DriveVLA-W0 世界模型如何给 VLA 大模型补上稠密监督
逐行拆解 BraveGroup/DriveVLA-W0 的已开源代码,面向零基础读者:先讲清 VLA、世界模型、MoE、Flow Matching、FAST tokenizer 等黑话,再厘清仓库边界(只开源了 policy_head 与 tokenizer,VLM 主干在外部库),然后逐文件拆解 MoE 动作专家、Flow Matching 解码器、扩散策略头、动作 tokenizer 与世界模型 VQ 编码器,最后把一次前向从图像到轨迹串成 7 步、讲透两阶段训练与推理旁路世界模型的设计。一篇把代码边界到数据流到关键模块到训练梯度到推理选轨迹到个人思考全部讲明白的极详细工程向代码讲解。
JUL
20
代码讲解:DiffusionDriveV2 — 用 GRPO 强化学习给截断扩散的多样轨迹「上安全锁」
「DiffusionDriveV2 在 DiffusionDrive 的 anchor 截断扩散之上,补了一套 GRPO 强化学习微调:用 scale-adaptive 乘性噪声做探索、Intra-Anchor GRPO 保住多模态不坍缩、Inter-Anchor Truncated GRPO 用碰撞惩罚把低质量轨迹压下去,最后加两级 Mode Selector 精排,在 NAVSIM v1 上冲到 91.2 PDMS。本文基于论文 Algorithm 还原成逐文件逐函数伪代码,从 cold start 权重加载写到 rollout → advantage → loss 的完整 RL 训练循环。」
JUL
20
代码讲解:DiffusionDrive 从架构到训练推理的完整闭环
逐行拆解 hustvl/DiffusionDrive 的真实源码,面向零基础读者:从架构图与全局数据流出发,用大白话讲清什么是 anchor、什么是去噪、什么是 cross-attention、什么是 BEV、什么是截断扩散,再逐文件讲清它如何作为 navsim 的 Agent 插件挂载,最后把一次前向传播拆成 7 到 8 步、把训练和推理的差异讲透。一篇把项目挂载方式→数据流→前向传播→训练梯度→推理选轨迹→个人思考全部讲明白的极详细工程向代码讲解。
JUL
20
VAD 代码讲解:把场景「矢量化」后,端到端能有多轻
「VAD 在 UniAD 之后走轻量化路线:把 agent、地图、运动全表示成向量(点和线),去掉占用栅格与分割头,VADv2 进一步把规划做成多模态概率分布,是回归式端到端走向生成式选择的关键过渡」
JUL
20
UniAD 代码讲解:端到端自动驾驶的「全栈 Transformer」是怎么拼起来的
「UniAD 把感知(检测/跟踪/建图/运动预测/占用)和规划全部塞进一条共享 query 的 Transformer 流水线,是 BEV 端到端感知-规划一体化的开山之作(CVPR 2023 Best Paper)。本文顺着 mmdet3d_plugin 的真实代码,逐个 head 讲清输入输出、forward 里到底做了什么,并拆穿两阶段训练为什么非这么干不可,零基础也能顺着数据流读懂整条链路」
JUL
20
pi0 代码讲解:通用 VLA 的「VLM 主干 + Flow Matching 动作专家」
「pi0 用 Google 的 PaliGemma 视觉语言模型当『懂场景、懂语言』的通用感知-语义主干,再并联挂一个独立的 Flow Matching 动作专家,通过 cross-attention 从 VLM 取特征,在 10 步 ODE Euler 积分内把随机噪声动作流到真实连续动作;本文顺着 Physical-Intelligence 官方 openpi 仓库,逐文件逐函数把 pi0.py 总装两塔、paligemma.py 封装主干、action_expert.py 的 Flow Matching 去噪、trainer.py 的向量场 MSE 损失、runtime.py 的 10 步 ODE 生成、transforms 里的动作 tokenize 与冻结策略讲透,并与 AutoVLA / DriveVLA-W0 做对照,最后把本系列九篇串成一条端到端自动驾驶与通用机器人 VLA 的演进线」
JUL
20
nuTruck 重卡安全驾驶策略研究
面向重卡场景的安全驾驶策略研究,关注侧翻与载荷滑移风险评估及动力学约束下的轨迹生成。
JUL
20
Flow-GRPO 源码学习与策略复现
基于 Flow-GRPO 的自动驾驶策略源码学习与复现记录,含小白友好的阅读顺序与教学注释。
JUL
20
Diffusion Policy 代码讲解:用 DDPM 给机器人「生成」一连串动作
「Diffusion Policy 把『给一段观察、出一段动作序列』做成条件扩散生成:噪声动作被 ConditionalUnet1D 逐步去噪,训练是 DDPM 标准损失(预测加到数据上的噪声、MSE),推理是 DDIM 多步采样(20~100 步),归一化必做且推理要 unnormalize 回真实量纲。本文顺着 real-stanford 官方仓库,从名词速查、架构总览、项目结构,到 ConditionalUnet1D / diffusion / diffusion_unet1d_policy / base_dataset / train_diffusion_policy 逐文件逐函数细讲,并穿插『为什么多步动作更稳、为什么扩散天然多模态、为什么归一化是命门』等认知,最后落到它作为 DiffusionDrive / Diffusion Planner / pi0 方法论母体的位置,是一篇面向零基础、超详细、篇幅足够长的工程向代码讲解」
JUL
20
Diffusion Planner 代码讲解:轨迹级扩散 + 免训练能量引导
「Diffusion Planner 把规划对象从『动作』升级为『整条轨迹』,用 DiT + MLP-Mixer 去噪;亮点是在 DDPM 采样时注入 classifier guidance(碰撞/可行驶区域/运动学能量),无需重新训练就能把轨迹压进可行域,本文顺着官方仓库从名词、架构、逐文件逐函数一直讲到多模态闭环评测,帮零基础读者把『轨迹级扩散 + 免训练能量引导』这条主线彻底打通」
JUL
20
AutoVLA 代码讲解:把「开车」变成「说动作 token」并用 GRPO 微调
「面向零基础读者逐行拆解 ucla-mobility/AutoVLA(NeurIPS 2025):从 VLA/动作 codebook/KMeans/快慢思考/SFT/GRPO 等概念讲起,配合论文架构图 + 自绘 SVG(整体架构、KMeans 聚类、两阶段训练流程),逐文件细讲 build_codebook 聚类、modeling_auto_vla 挂 action_head、LoRA 微调策略、SFT 数据模板设计、Stage-2 RFT 拒绝采样精修、推理旁路,最后给出个人思考与系列关系」
JUL
20
论文精读:Longitudinal Safety Distance Control Considering Cargo Load(ICVES 2025)——RSS 安全距离模型为什么漏算了满载重卡的刹车
ICVES 2025 论文 Longitudinal Safety Distance Control Considering Cargo Load for Autonomous Heavy-Duty Vehicles 指出经典 RSS 安全距离模型假设车辆质量恒定,忽略了货物载荷,导致满载重卡制动距离更长、RSS 给出的安全距离不足而撞车。本文从 RSS 公式出发,讲清质量/载荷如何修正制动距离,并呼应博客 nuTruck 一文:现有 benchmark 不把质量/动力学安全作为指标。
JUL
20
论文精读|TruckV2X:首个以重卡为中心的 V2X 车路协同感知数据集,专治盲区与挂车遮挡
TruckV2X (IEEE RA-L 2025) 是首个以半挂重卡为中心的 V2X 多模态多智能体协同感知数据集,用 CARLA 仿真构建 64 个场景、88,396 帧点云、百万图像、118 万 3D 框,覆盖牵引车-挂车-CAV-RSU 四类智能体,系统性揭示重卡因车身长、挂车摆动、转弯内侧盲区而对车路协同的刚需。
JUL
20
论文精读|MAN TruckScenes — 第一个面向重卡自动驾驶的多模态数据集,把 4D 雷达做成 360° 全覆盖
MAN TruckScenes 是 MAN Truck & Bus 与慕尼黑工业大学在 NeurIPS 2024 Datasets & Benchmarks 提出的第一个面向自动驾驶重卡的多模态数据集,含 747 个 20 秒场景、4 相机 + 6 激光雷达 + 6 个 4D 雷达 + 双 IMU + 高精度 GNSS,标注范围超 230 米、27 个物体类、34 个场景标签,并首次提供 360° 覆盖的 4D 雷达点云与带 3D 框标注,配套 nuScenes 格式 devkit 与 CenterPoint/RadarGNN/PETR 基线。本文面向刚入行的 VLA 工程师,用大白话拆解它的传感器布局、卡车特有挑战、标注与切分、以及给端到端重卡模型带来的长距离鲁棒感知问题。
JUL
20
论文精读|AutoVLA:用自适应推理与 GRPO 微调统一「思考」与「动作」的端到端 VLA
AutoVLA(NeurIPS 2025, UCLA)把「链式推理 CoT」与「物理动作 token 化」塞进同一个自回归生成模型,用一套代码本把连续轨迹离散成可行动作,再用 SFT 训练出快思考(只出轨迹)与慢思考(带 CoT 推理)双模式,最后用 GRPO 强化微调在简单场景关掉多余推理。它是 NAVSIM v1 上 VLA 路线的代表基线(PDMS 89.1 / 92.1+锚点),也是 DriveVLA-W0 的主要对比对象。