个人思考|VLA 都有了视觉编码器,为什么还需要感知模块?

VLA(Vision-Language-Action)模型自带 ViT 视觉编码器,为什么自动驾驶还需要 3D 检测、BEV 感知、占用网络这些传统感知模块?它们之间到底是替代关系还是互补关系?本文从 14 篇论文精读出发,盘点感知与 VLM 的十种协同模式,详解有 BEV 与无 BEV 感知的实现方法,并解释为什么只有 2D 相机、没有显式 BEV/occ 的模型也能表现不错——关键在于区分’感知任务’与’显式感知表示’。

2026年7月27日 · 9 分钟 · 1851 字 · 

个人思考|自动驾驶感知模块全景:从传感器到BEV再到占用网络,到底在感知什么

一篇全景式讲解自动驾驶感知模块的技术文章。从传感器硬件讲起,覆盖3D目标检测、BEV感知、占用网络、语义分割、多目标跟踪,以及它们如何输出给下游的预测和规划模块。附完整感知流水线图。

2026年7月27日 · 4 分钟 · 650 字 · 

个人思考|自动驾驶技术全景学习指南:从基础到前沿的六范式知识体系

一份面向自动驾驶从业者的全景式学习指南。系统梳理六大技术范式(端到端E2E、VLA、世界模型、Scoring规划、JEPA、RL+生成)的核心概念、代表工作、联系脉络和知识依赖。附自测清单和推荐阅读路线,帮助你定位自己的知识短板。

2026年7月27日 · 11 分钟 · 2255 字 · 

个人思考|JEPA-DRIVE:用联合嵌入预测架构做自监督驾驶决策

JEPA-DRIVE 是一个基于 Joint Embedding Predictive Architecture 的自监督驾驶决策系统。它用结构化隐空间世界模型编码驾驶场景,从 65,536 个离散行为词汇中组合生成候选轨迹,再用 cycle energy 重建误差作为自监督评分信号。V17 在 NAVSIM 上达到 0.8839 selected_pdm,V21 正在用纯自监督 cycle energy 突破 PDM 代理标签的 64 值瓶颈(8×A800 分布式训练中)。全模型仅 3.88M 参数。

2026年7月24日 · 8 分钟 · 1561 字 · 

个人思考|强化学习 + 生成式轨迹规划:四种范式、核心挑战与未来方向

RL + 生成式轨迹是 2025-2026 最火热的方向之一。本文从一个小白的视角,梳理 SFT 的天花板、四种 RL 范式(奖励引导、拒绝采样、策略梯度、世界模型),深入分析 log-prob 难题和 reward hacking,用大量对比图和流程图让每个概念一目了然。最后给出了自己的理解和未来方向判断。

2026年7月22日 · 16 分钟 · 3355 字 · 

自动驾驶学习路径总目录|用我的论文精读串成的金字塔地图

参考’少读要比乱读强’的思路,把我论文精读区的文章按’地基→BEV感知→端到端→世界模型→扩散+强化学习→VLA’六层金字塔组织起来。顺着层往上走,每层解决上一层留下的问题,最后落在 VLA/世界模型这些前沿范式上。这是本站论文精读的总入口。

2026年8月5日 · 3 分钟 · 428 字 · 

自动驾驶优质博客收藏夹|随手存,少逛,逛精

把平时刷到的优秀自动驾驶博客/资源链接集中存到这里,避免日后找不到。主打一个’少逛、逛精’——每篇能持续产出高质量内容才放进收藏。持续更新。

2026年8月5日 · 1 分钟 · 108 字 · 

SimWAM 代码完整解读:从 Video DiT 到 Action DiT,从 SFT 到 FlowGRPO 的逐行拆解

从 configs/model/simwam_navsim.yaml 第 1 行开始,逐层追踪 SimWAM 的完整逻辑链:两个专家怎么协作?Isolated Attention Mask 怎么实现训练时借力、推理时独立?联合 Flow Matching 训练的损失怎么算?FlowGRPO 的 SDE 采样、PDM 奖励、LoRA 微调怎么串起来?每段代码都标注了源文件路径。

2026年9月6日 · 18 分钟 · 3703 字 · 

Flow-GRPO 完全讲解:训练/推理/梯度流/Loss 设计的逐行拆解

从 train_flux_fast.py 第 1 行开始,逐层追踪 Flow-GRPO 的完整逻辑链:采样阶段做了什么?reward 怎么变成 advantage?训练阶段的计算图是怎么构造的?loss 为什么那样设计?梯度如何从最后一个 log_prob 传到 LoRA 参数?每段代码都标注了源文件行号。

2026年7月30日 · 24 分钟 · 5063 字 · 

端到端自动驾驶模型架构全解:从感知到规划的六大范式与 80+ 模型逐篇拆解

一、为什么写这篇文章 本博客陆续精读了 100+ 篇自动驾驶与机器人模型论文——从感知基座(BEVFormer/Sparse4D),到显式端到端(UniAD/VAD/SparseDrive),到打分式(CLOVER/Hydra-MDP/GTRS),到扩散与 Flow 生成(DiffusionDrive/TransDiffuser/GoalFlow),再到 VLA 大模型(DriveVLM/EMMA/AutoVLA/LinkVLA)与世界模型(Cosmos/DriveFuture/WoTE)。单独看是逐篇精读,放在一起,端到端自动驾驶在 感知 → 预测 → 决策 → 规划 四个架构维度上的演进脉络其实非常清晰。 这篇文章把博客里所有精读过的模型收进同一个坐标系,回答三个问题: 感知:从稠密 BEV 到稀疏 query 再到纯视觉 token、几何寄存器,一路在换什么? 预测/决策/规划:从显式管线到打分排序、扩散生成、Flow 整流、LLM 推理、世界模型 roll-out,谁在取代谁?谁融合了谁? 谁真正有效:把彼此在 NAVSIM 上的 PDMS/EPDMS 分数和架构创新对照起来,看看分数到底来自技巧还是来自架构。 本文每个模型给"流派 → 核心创新 → 架构拆解(骨干/模块/输出/训练) → 代表分数“四个维度,尽量讲清楚架构;分数严格区分官方排行榜与 arXiv 自报,口径不一致处会注明。机器人侧的 VLA 模型(RT 系列、π0)作为同源背景单列一节——它们定义了「动作 token」「动作分块」「Flow 动作头」这三个被驾驶侧反复借用的组件。 二、先立坐标系:六大流派一张图 按「感知表征 × 规划输出方式」两个维度,我把博客里的方法归为六大流派: 流派 代表模型 核心思想 感知表征 规划输出 ① 显式端到端管线 UniAD、VAD、VADv2、SparseDrive、PARA-Drive、DriveTransformer、TransFuser 感知/预测/规划在同一个可训练网络里串起来 稠密 BEV / 稀疏 token / 寄存器 单条/多条轨迹回归 ② 评分排序式 (Scoring) CLOVER、Hydra-MDP、GTRS、SparseDriveV2、TOAD、GoalFlow 大量生成候选,再学打分器(或用搜索/流)选出最优 稀疏特征 / 轨迹词汇表 / 目标点 从候选集合中选 Top-1 ③ 扩散/Flow 生成式 DiffusionDrive、DiffusionPlanner、TransDiffuser、SafeDiffuser、FeaXDrive、Gen-Drive 把规划当成从噪声里生成(DDPM / Flow Matching / 整流流) 稀疏感知 / BEV / 图像 多模态轨迹生成 ④ VLA 大模型式 DriveVLM、EMMA、AutoVLA、LinkVLA、OneVL、LaST-VLA、WCog-VLA LLM/VLM 做感知+推理+决策,语言或 token 输出动作 视觉 token / 稀疏 query / 隐 token 语言决策 / 轨迹 token ⑤ 世界模型式 Cosmos、DriveFuture、WoTE、DreamerV3、DLWM、RAW2Drive、ReWorld 建模环境动力学/未来状态,以未来为条件或打分规划 隐潜 / 视频 token / BEV 未来帧 条件化/打分/rollout 规划 ⑥ 数据与评测基建 Bench2Drive、CARLA、K-Risk、MOSAIC、重卡数据集族 提供闭环基准、数据选择、仿真、安全分析 — — 一句话直觉:① 是"手拉手串行提线木偶”,② 是"多打几遍再挑",③ 是"从噪声里一遍遍画",④ 是"读得懂交规再动手",⑤ 是"先在脑内模拟未来再决定",⑥ 是"让前面所有流派有地方比"。六大流派不是互相淘汰,而是逐层叠加——今天最强的系统几乎都是 ②③⑤ 的混合。 ...

2026年8月10日 · 11 分钟 · 2231 字 · 

纯视觉端到端模型在 Cosmos 风格迁移加持下的 NAVSIM 大规模评测:11 个开源模型全景

0. 写在前面:我们需要一份"会晒黑的评测" 现阶段启用的 benchmark 大多默认天气晴朗、光照良好、纹理干净,视觉端到端模型的感知在这个"温室"里表现优秀。但当复用习惯了晴天的视觉 planner 进入真实世界——阴雨路面积水反光、雪天车道线被覆盖、黄昏光照死黑——它的 No-at-fault Collision 和 Drivable Area Compliance 往往断崖式下跌。“能不能开"和"换了个风格还能不能开"是两种能力。 课题组这一轮想做的,就是用 Cosmos(NVIDIA 的世界基础模型)做光照/天气/纹理的风格迁移(rain / snow / 日夜 / 模糊),在不改变场景拓扑、导航指令和 agents 语义的前提下,把同一份 NAV 场景"换皮”,得到一组视觉域被扰动、但语义标签不变的评测集,然后再跑纯视觉 end-to-end 模型在 NAV 上的 PDMS。这样我们拿到的不只是一个数字,而是一张"模型在位姿、外观扰动下的鲁棒性画像",可以回答:哪个模型在风格漂移下最硬?哪个只在晴天强? 0.1 选型逻辑:为什么是这 11 个 入选标准明确,缺一不可: camera-only(纯视觉):必须只吃相机输入,不能依赖 LiDAR 点云。这样"风格迁移只改图像"才能干净地、真实地作用到模型输入上。 NAV 可跑:官方有 NAV 相关权重或可复现配置,能进入我们的批量评测管线(Agent API 封装)。 论文开源:能从 arXiv 拿到原文架构与打分细节。 覆盖技术谱系:从规则化生成型(LTF)到高分辨率稀疏语义 (SparseDriveV2)、proposal 中心式(iPad)、扩散/飞流式(DrivoR、Drive-JEPA、DriveLaW)、再到 VLA 语言世界模型(ChainFlow-VLA、AutoVLA、ReCogDrive、DriveVLA-W0)——我们想测的是"在哪一种范式上,风格迁移造成的伤害最小"。 于是,最终敲定了下面 11 个:SparseDriveV2、iPad、DrivoR、ChainFlow-VLA、AutoVLA、ReCogDrive、DriveVLA-W0、Drive-JEPA、DriveSuprim、DriveLaW、LTF(Latent TransFuser)。 下面我会给每个模型:一句话定位 → 架构解读(附 arXiv 原文架构图)→ 官方资源(仓库/HF)→ 评测配置 → NAV 得分 → 在我们风格迁移评测里值得画的重点。 ...

2026年8月7日 · 5 分钟 · 1029 字 · 

Cosmos-3 + MoE + Flow-GRPO 架构概览

本文提出一种将 Cosmos-3 双塔 MoT、DeepSeek-style Sparse MoE、Flow Matching 与 Flow-GRPO 结合的架构设计方案,系统描述各模块的角色、接口与训练推理流程。

2026年7月23日 · 2 分钟 · 412 字 · 

思考|重卡 VLA 是一个巨大的研究空白——兼论 Truck-VLA 架构设计

引言:100 篇 VLA 论文,0 篇属于重卡 如果你关注自动驾驶领域的最新进展,一定注意到 2024-2026 年间 VLA(Vision-Language-Action)模型的爆发式增长。从 AutoVLA、DriveVLM、EMMA、OpenDriveVLA 到 SAMoE-VLA、LaST-VLA、UniDriveVLA,光是 arXiv 上能找到的自动驾驶 VLA 论文就已超过 100 篇。 但这里有一个令人震惊的事实: 这 100+ 篇论文,没有一篇专门针对重卡(heavy-duty truck)场景。 所有模型都在乘用车数据集(nuScenes、Waymo Open Dataset、Bench2Drive、CARLA)上训练和评测。 与此同时,重卡自动驾驶的产业化进程正在加速:Aurora 于 2025 年在德州启动了无安全员的 L4 商业运营,Kodiak AI 已将 VLM 部署在自家卡车感知栈上,Torc Robotics 计划 2027 年量产 L4 卡车。重卡自动驾驶的市场需求是真实且急迫的——美国卡车运输业每年承担着超过 7000 亿美元的货物运输,卡车司机缺口超过 10 万人。然而学术界对重卡 VLA 的研究仍然是一片空白。这不仅是学术上的缺憾,更是产业落地的关键瓶颈。 本文的目标是: 定义这个空白:为什么现有 VLA 方法不能直接迁移到重卡? 分析根本原因:哪些维度造成了迁移障碍? 提出架构方案:Truck-VLA 应该怎么设计? 给出路线图:从哪里开始填补这个空白? 一、VLA 简史:从 VA 到 VLA 的演进 在深入重卡之前,先回顾一下自动驾驶 VLA 的整体图景。 1.1 三个时代 自动驾驶的"感知-决策-控制"管线经历了三个阶段: VA 时代(2016-2023):视觉-动作模型,直接从传感器映射到控制输出。代表工作包括 ALVINN、ChauffeurNet、TransFuser、UniAD、VAD。核心局限是黑盒推理、长尾泛化差、无法理解语言指令。这一时期的模型本质上是"感知→轨迹"的纯回归映射,缺乏显式推理能力。 ...

2026年7月23日 · 12 分钟 · 2451 字 · 

如何在NAVSIM刷到PDMS 90分以上

引言 NAVSIM 排行榜的竞争已经到了白热化阶段。从最初的 80 分出头到现在的 94.5 分(CLOVER),短短两年时间,顶尖方案的 PDMS 提升了 15 个点。如果你正在读这篇文章,大概率是两种人:一是想在排行榜上刷个高分的选手,二是研究自动驾驶规划、想理解 Scoring-based 范式演进方向的研究者。 这篇文章不讲虚的,直接切入正题:到底怎么才能在 NAVSIM 上把 PDMS 刷到 90 分? 我会结合 NAVSIM 排行榜上所有公开的高分方案(CLOVER、CLEAR、DriveFuture、Hydra-MDP 以及各种 VLA + RL 方案),从 PDMS 公式的数学结构出发,逐层拆解每个分数段的瓶颈和对应的策略。 先给个核心结论:PDMS 90+ 的秘密不在于模型多强大,而在于你是否真正理解了 Scoring 范式的每个环节。 一、PDMS 公式:分数结构决定了优化策略 如果你还不知道 PDMS 怎么算的,那先把这块搞清楚。分数结构本身就在告诉你该优化什么。 PDMS 公式拆解 1.1 公式结构 记住这个公式: PDMS = NC × DAC × (5·EP + 5·TTC + 2·C) / 12 这里最应该引起你注意的是乘性结构:NC 和 DAC 是乘法项,意味着任何一个为零,整体分数直接归零。这不是简单的加减法,这是一个"安全第一,前进第二"的奖励结构。 加性部分是 (5·EP + 5·TTC + 2·C) / 12,EP 和 TTC 各占 5 份权重,C 只占 2 份。 ...

2026年7月22日 · 11 分钟 · 2327 字 ·