SimWAM 代码完整解读:从 Video DiT 到 Action DiT,从 SFT 到 FlowGRPO 的逐行拆解

从 configs/model/simwam_navsim.yaml 第 1 行开始,逐层追踪 SimWAM 的完整逻辑链:两个专家怎么协作?Isolated Attention Mask 怎么实现训练时借力、推理时独立?联合 Flow Matching 训练的损失怎么算?FlowGRPO 的 SDE 采样、PDM 奖励、LoRA 微调怎么串起来?每段代码都标注了源文件路径。

2026年9月6日 · 18 分钟 · 3703 字 · 

思考|重卡 VLA 是一个巨大的研究空白——兼论 Truck-VLA 架构设计

引言:100 篇 VLA 论文,0 篇属于重卡 如果你关注自动驾驶领域的最新进展,一定注意到 2024-2026 年间 VLA(Vision-Language-Action)模型的爆发式增长。从 AutoVLA、DriveVLM、EMMA、OpenDriveVLA 到 SAMoE-VLA、LaST-VLA、UniDriveVLA,光是 arXiv 上能找到的自动驾驶 VLA 论文就已超过 100 篇。 但这里有一个令人震惊的事实: 这 100+ 篇论文,没有一篇专门针对重卡(heavy-duty truck)场景。 所有模型都在乘用车数据集(nuScenes、Waymo Open Dataset、Bench2Drive、CARLA)上训练和评测。 与此同时,重卡自动驾驶的产业化进程正在加速:Aurora 于 2025 年在德州启动了无安全员的 L4 商业运营,Kodiak AI 已将 VLM 部署在自家卡车感知栈上,Torc Robotics 计划 2027 年量产 L4 卡车。重卡自动驾驶的市场需求是真实且急迫的——美国卡车运输业每年承担着超过 7000 亿美元的货物运输,卡车司机缺口超过 10 万人。然而学术界对重卡 VLA 的研究仍然是一片空白。这不仅是学术上的缺憾,更是产业落地的关键瓶颈。 本文的目标是: 定义这个空白:为什么现有 VLA 方法不能直接迁移到重卡? 分析根本原因:哪些维度造成了迁移障碍? 提出架构方案:Truck-VLA 应该怎么设计? 给出路线图:从哪里开始填补这个空白? 一、VLA 简史:从 VA 到 VLA 的演进 在深入重卡之前,先回顾一下自动驾驶 VLA 的整体图景。 1.1 三个时代 自动驾驶的"感知-决策-控制"管线经历了三个阶段: VA 时代(2016-2023):视觉-动作模型,直接从传感器映射到控制输出。代表工作包括 ALVINN、ChauffeurNet、TransFuser、UniAD、VAD。核心局限是黑盒推理、长尾泛化差、无法理解语言指令。这一时期的模型本质上是"感知→轨迹"的纯回归映射,缺乏显式推理能力。 ...

2026年7月23日 · 12 分钟 · 2451 字 · 

论文精读|TransDiffuser:去相关多模态表示驱动的扩散式轨迹生成

LiAuto 提出 TransDiffuser,用多模态表示去相关(Decorrelation)解决扩散轨迹生成中的模式坍缩问题。核心思路是强制多模态条件特征的维度去相关,让条件信号更丰富地覆盖潜空间,从而无需任何锚点轨迹或场景先验即可生成多样化轨迹。ResNet-34 + LiDAR 配置在 NAVSIM 上达到 PDMS 94.85。本文将用一张图一张图对应讲解的方式,把这篇论文的动机、架构、核心创新全部讲清楚。

2026年7月22日 · 5 分钟 · 968 字 · 

Flow-GRPO 源码学习与策略复现

基于 Flow-GRPO 的自动驾驶策略源码学习与复现记录,含小白友好的阅读顺序与教学注释。

2026年7月20日 · 1 分钟 · 26 字 · 

UniAD 代码讲解:端到端自动驾驶的「全栈 Transformer」是怎么拼起来的

「UniAD 把感知(检测/跟踪/建图/运动预测/占用)和规划全部塞进一条共享 query 的 Transformer 流水线,是 BEV 端到端感知-规划一体化的开山之作(CVPR 2023 Best Paper)。本文顺着 mmdet3d_plugin 的真实代码,逐个 head 讲清输入输出、forward 里到底做了什么,并拆穿两阶段训练为什么非这么干不可,零基础也能顺着数据流读懂整条链路」

2026年7月20日 · 6 分钟 · 1166 字 · 

VAD 代码讲解:把场景「矢量化」后,端到端能有多轻

「VAD 在 UniAD 之后走轻量化路线:把 agent、地图、运动全表示成向量(点和线),去掉占用栅格与分割头,VADv2 进一步把规划做成多模态概率分布,是回归式端到端走向生成式选择的关键过渡」

2026年7月20日 · 8 分钟 · 1587 字 · 

端到端驾驶评测指标全景

一、引言 端到端自动驾驶模型的快速发展对评测体系提出了迫切需求。从早期的行为克隆论文仅报告 L2 位移误差,到如今 NAVSIM、nuPlan、Bench2Drive、CARLA 等多个基准各自定义复杂的复合指标,评测指标呈现出"从单一到综合、从开环到闭环、从粗粒度到细粒度"的演进趋势。 然而,指标选择本身也成为了一个需要深思熟虑的问题——不同的指标反应驾驶质量的不同侧面,单一指标往往存在偏差。理解每个指标的设计动机、计算细节和局限性,是做出可信研究的必要条件。 本文系统梳理端到端驾驶评测领域的主流指标,涵盖开环指标、闭环综合指标、按场景分解指标以及成功率等,并分析各指标之间的关联与互补关系。 二、开环评测指标 开环指标衡量模型预测轨迹与人类真值轨迹之间的差距,虽然不直接反映真实驾驶能力,但因其计算简单、可复现性强而被广泛使用。 2.1 L1/L2 位移误差 定义:在未来时刻 t(通常取 1.0s、2.0s、3.0s)上,预测位置与真值位置之间的距离。 公式: L A F 2 D D _ E E t = = = 1 | | / P P T _ _ ) p p r r × e e d d Σ ( ( _ T t t ) ) - - | P P P _ _ _ p g g r t t e ( ( d T t ( ) ) t | | | | ₂ ₂ - P _ g t ( t ) | | ₂ 解读:L2 误差越小越好,但存在显著的饱和效应——当误差降到一定程度后,进一步降低 L2 未必意味着更好的驾驶能力。更严重的问题是:L2 误差对轨迹的"合理性"完全不敏感,一个不安全的急刹车轨迹和一个安全的平稳减速轨迹可能有相同的 L2 误差。此外,L2 误差也无法区分横向偏差和纵向偏差——偏离车道 0.5 米和速度偏差 5 km/h 可能产生相同的 L2 值。 ...

2026年7月19日 · 5 分钟 · 882 字 · AutoDriving Blog ·