技术博客

自动驾驶 VLA · 世界模型 · 端到端 · 前沿论文精读与知识分享

📅 2026
JUL 27
个人思考|自动驾驶技术全景学习指南:从基础到前沿的六范式知识体系
一份面向自动驾驶从业者的全景式学习指南。系统梳理六大技术范式(端到端E2E、VLA、世界模型、Scoring规划、JEPA、RL+生成)的核心概念、代表工作、联系脉络和知识依赖。附自测清单和推荐阅读路线,帮助你定位自己的知识短板。
🧠 VLA 🔗 端到端 🔮 世界模型 ⚡ Scoring 🧩 JEPA
JUL 27
个人思考|自动驾驶感知模块全景:从传感器到BEV再到占用网络,到底在感知什么
一篇全景式讲解自动驾驶感知模块的技术文章。从传感器硬件讲起,覆盖3D目标检测、BEV感知、占用网络、语义分割、多目标跟踪,以及它们如何输出给下游的预测和规划模块。附完整感知流水线图。
感知 BEV 占用网络 3D检测 多传感器融合
JUL 27
个人思考|VLA 都有了视觉编码器,为什么还需要感知模块?
VLA(Vision-Language-Action)模型自带 ViT 视觉编码器,为什么自动驾驶还需要 3D 检测、BEV 感知、占用网络这些传统感知模块?它们之间到底是替代关系还是互补关系?本文从 14 篇论文精读出发,盘点感知与 VLM 的十种协同模式,详解有 BEV 与无 BEV 感知的实现方法,并解释为什么只有 2D 相机、没有显式 BEV/occ 的模型也能表现不错——关键在于区分'感知任务'与'显式感知表示'。
VLA 感知 BEV 3D检测 多传感器融合
JUL 24
论文精读|MOSAIC:面向端到端自动驾驶的缩放感知数据选择
MOSAIC 提出三阶段数据选择框架:聚类分域 → 拟合神经缩放定律 → 迭代选择最大化指标边际增益。在 NAVSIM 上使用 Hydra-MDP 模型,以 42% 更少数据达到全量训练性能,EPDMS 最优。来自 NVIDIA 和 NYU 的 CVPR 2026 工作。
📊 数据缩放 🎯 数据选择 🚗 自动驾驶 🔗 端到端 📐 缩放定律
JUL 24
论文精读|RAW2Drive:对齐世界模型的强化学习端到端驾驶
RAW2Drive 提出双流模型基强化学习框架,先用特权信息(BEV 语义)高效训练特权世界模型+策略,再通过对齐机制引导原始传感器世界模型的学习,实现首个从原始传感器直接规划端到端 MBRL 方法。在 Bench2Drive 上 DS 达 83.5,超越所有原始传感器基线。
🎮 强化学习 🌍 世界模型 🚗 自动驾驶 🔗 端到端 🎯 模型基强化学习
JUL 24
论文精读|DLWM:双潜在世界模型实现高斯中心的全方位预训练
DLWM 提出双阶段自监督预训练范式:第一阶段用多视图语义和深度重建学习 3D 高斯场景表示;第二阶段训练双潜在世界模型——高斯流引导的潜在预测(占据感知/预测)和自车规划引导的潜在预测(运动规划)。在 nuScenes 上占据预测 +1.02 mIoU,规划 L2 误差降低 16%。
🌍 世界模型 🎯 3D高斯 🚗 自动驾驶 🏗️ 预训练 📐 占据预测
JUL 24
论文精读|VLA Safety Survey:视觉-语言-动作模型安全的全面综述
这是首篇系统梳理 VLA 安全的综述,从攻击时机(训练时/推理时)和防御时机(训练时/推理时)两条平行轴组织文献,涵盖数据投毒、后门攻击、对抗补丁、跨模态扰动、语义越狱等威胁及对应防御,并讨论了 6 大部署领域的安全挑战。
🔒 安全 📋 综述 🚗 自动驾驶 🤖 具身智能 ⚠️ 对抗攻击
JUL 24
论文精读|NoRD:无需推理的高效数据驱动 VLA
NoRD 挑战 VLA 对大规模数据和推理标注的依赖,仅用 60% 数据 + 零推理标注即可达到可比性能。核心发现是标准 GRPO 在弱策略上由于难度偏差(Difficulty Bias)失效,引入 Dr.GRPO 后从 0.67% 提升扭转为 11.68% 的显著增益。
⚡ GRPO 🎮 强化学习 🚗 自动驾驶 🔗 端到端 📐 数据效率
JUL 24
论文精读|ST4VLA:空间引导训练实现鲁棒的视觉-语言-动作模型
ST4VLA 提出双阶段空间引导训练框架:第一阶段用点、框、轨迹预测进行空间接地预训练注入空间先验;第二阶段用空间提示引导动作生成。在 SimplerEnv 上 Google Robot 从 66.1 提升到 84.6,WidowX 从 54.7 提升到 73.2,并展现对未见物体和复杂长时任务的强泛化。
🧭 空间引导 🤖 具身智能 🚗 自动驾驶 🎯 视觉-语言-动作 🏗️ 预训练
JUL 24
论文精读|LinkVLA:统一语言-动作理解与生成的 VLA 架构
LinkVLA 提出将语言指令和驾驶轨迹统一到共享离散词表的 VLA 架构,通过对数坐标变换+空间软标签实现连续轨迹的离散化,引入动作理解反向目标建立双向语义映射,并用 C2F 两步解码替代逐点自回归。在 Bench2Drive (CARLA v2) 上 DS 达 91.01(超 SimLingo 5.94 分,+6.98%),推理延迟从 361ms 降到 48ms。主要作者来自浙大和理想汽车,收录于 CVPR 2026。
🔗 端到端 🚗 自动驾驶 📐 轨迹规划 🎯 语言-动作对齐
JUL 24
个人思考|JEPA-DRIVE:用联合嵌入预测架构做自监督驾驶决策
JEPA-DRIVE 是一个基于 Joint Embedding Predictive Architecture 的自监督驾驶决策系统。它用结构化隐空间世界模型编码驾驶场景,从 65,536 个离散行为词汇中组合生成候选轨迹,再用 cycle energy 重建误差作为自监督评分信号。V17 在 NAVSIM 上达到 0.8839 selected_pdm,V21 正在用纯自监督 cycle energy 突破 PDM 代理标签的 64 值瓶颈(8×A800 分布式训练中)。全模型仅 3.88M 参数。
🧠 JEPA 🚗 自动驾驶 🎯 自监督学习 📐 世界模型 ⚡ 推演式决策
JUL 23
思考|重卡 VLA 是一个巨大的研究空白——兼论 Truck-VLA 架构设计
引言:100 篇 VLA 论文,0 篇属于重卡 如果你关注自动驾驶领域的最新进展,一定注意到 2024-2026 年间 VLA(Vision-Language-Action)模型的爆发式增长。从 AutoVLA、DriveVLM、EMMA、OpenDriveVLA 到 SAMoE-VLA、LaST-VLA、UniDriveVLA,光是 arXiv 上能找到的自动驾驶 VLA 论文就已超过 100 篇。 但这里有一个令人震惊的事实: 这 100+ 篇论文,没有一篇专门针对重卡(heavy-duty truck)场景。 所有模型都在乘用车数据集(nuScenes、Waymo Open Dataset、Bench2Drive、CARLA)上训练和评测。 与此同时,重卡自动驾驶的产业化进程正在加速:Aurora 于 2025 年在德州启动了无安全员的 L4 商业运营,Kodiak AI 已将 VLM 部署在自家卡车感知栈上,Torc Robotics 计划 2027 年量产 L4 卡车。重卡自动驾驶的市场需求是真实且急迫的——美国卡车运输业每年承担着超过 7000 亿美元的货物运输,卡车司机缺口超过 10 万人。然而学术界对重卡 VLA 的研究仍然是一片空白。这不仅是学术上的缺憾,更是产业落地的关键瓶颈。 本文的目标是: 定义这个空白:为什么现有 VLA 方法不能直接迁移到重卡? 分析根本原因:哪些维度造成了迁移障碍? 提出架构方案:Truck-VLA 应该怎么设计? 给出路线图:从哪里开始填补这个空白? 一、VLA 简史:从 VA 到 VLA 的演进 在深入重卡之前,先回顾一下自动驾驶 VLA 的整体图景。 1.1 三个时代 自动驾驶的"感知-决策-控制"管线经历了三个阶段: VA 时代(2016-2023):视觉-动作模型,直接从传感器映射到控制输出。代表工作包括 ALVINN、ChauffeurNet、TransFuser、UniAD、VAD。核心局限是黑盒推理、长尾泛化差、无法理解语言指令。这一时期的模型本质上是"感知→轨迹"的纯回归映射,缺乏显式推理能力。
重卡VLA Truck-VLA 研究空白 端到端 动力学安全
JUL 23
Cosmos-3 + MoE + Flow-GRPO 架构概览
本文提出一种将 Cosmos-3 双塔 MoT、DeepSeek-style Sparse MoE、Flow Matching 与 Flow-GRPO 结合的架构设计方案,系统描述各模块的角色、接口与训练推理流程。
架构 Cosmos-3 Sparse MoE Flow-GRPO VLA
JUL 22
如何在NAVSIM刷到PDMS 90分以上
引言 NAVSIM 排行榜的竞争已经到了白热化阶段。从最初的 80 分出头到现在的 94.5 分(CLOVER),短短两年时间,顶尖方案的 PDMS 提升了 15 个点。如果你正在读这篇文章,大概率是两种人:一是想在排行榜上刷个高分的选手,二是研究自动驾驶规划、想理解 Scoring-based 范式演进方向的研究者。 这篇文章不讲虚的,直接切入正题:到底怎么才能在 NAVSIM 上把 PDMS 刷到 90 分? 我会结合 NAVSIM 排行榜上所有公开的高分方案(CLOVER、CLEAR、DriveFuture、Hydra-MDP 以及各种 VLA + RL 方案),从 PDMS 公式的数学结构出发,逐层拆解每个分数段的瓶颈和对应的策略。 先给个核心结论:PDMS 90+ 的秘密不在于模型多强大,而在于你是否真正理解了 Scoring 范式的每个环节。 一、PDMS 公式:分数结构决定了优化策略 如果你还不知道 PDMS 怎么算的,那先把这块搞清楚。分数结构本身就在告诉你该优化什么。 PDMS 公式拆解 1.1 公式结构 记住这个公式: PDMS = NC × DAC × (5·EP + 5·TTC + 2·C) / 12 这里最应该引起你注意的是乘性结构:NC 和 DAC 是乘法项,意味着任何一个为零,整体分数直接归零。这不是简单的加减法,这是一个"安全第一,前进第二"的奖励结构。 加性部分是 (5·EP + 5·TTC + 2·C) / 12,EP 和 TTC 各占 5 份权重,C 只占 2 份。
NAVSIM PDMS CLOVER Scoring-based 自动驾驶
JUL 22
论文精读|TransDiffuser:去相关多模态表示驱动的扩散式轨迹生成
LiAuto 提出 TransDiffuser,用多模态表示去相关(Decorrelation)解决扩散轨迹生成中的模式坍缩问题。核心思路是强制多模态条件特征的维度去相关,让条件信号更丰富地覆盖潜空间,从而无需任何锚点轨迹或场景先验即可生成多样化轨迹。ResNet-34 + LiDAR 配置在 NAVSIM 上达到 PDMS 94.85。本文将用一张图一张图对应讲解的方式,把这篇论文的动机、架构、核心创新全部讲清楚。
扩散模型 自动驾驶 轨迹规划 端到端 表示学习
JUL 22
AlpaMayo-R1 代码讲解:VLM 说推理链、Expert 雕轨迹、一个模型两套头
零基础逐文件拆解 NVIDIA AlpaMayo-R1 推理源码:从 VLM/Expert/Diffusion 三组件架构到单轮动力学动作空间,从 Flow Matching 去噪到 Fourier 特征编码,用伪代码 + 大白话讲清这个 10B 参数的 VLA 模型是怎么从传感器数据一路「推理」到轨迹输出的。
VLA 扩散模型 因果推理 GRPO 代码讲解
JUL 22
论文精读|AlpaMayo-R1:因果推理链 + RL 驱动的 VLA 驾驶策略
NVIDIA 提出 AlpaMayo-R1,一个融合 Chain of Causation 因果推理与 GRPO 强化学习的 VLA 模型。它基于 Cosmos-Reason VLM 骨干,通过结构化 CoC 数据集实现决策锚定的因果推理,利用 Flow Matching 动作解码器生成连续轨迹。三阶段训练(动作注入→推理微调→RL后训练)在长尾场景中取得显著提升:规划准确率 +12%,近距离冲突率 -35%,推理质量 +45%。真车路测延迟仅 99ms。
🎮 强化学习 ⚡ GRPO 🚗 自动驾驶 📐 策略优化
JUL 22
个人思考|强化学习 + 生成式轨迹规划:四种范式、核心挑战与未来方向
RL + 生成式轨迹是 2025-2026 最火热的方向之一。本文从一个小白的视角,梳理 SFT 的天花板、四种 RL 范式(奖励引导、拒绝采样、策略梯度、世界模型),深入分析 log-prob 难题和 reward hacking,用大量对比图和流程图让每个概念一目了然。最后给出了自己的理解和未来方向判断。
🤔 个人思考 🎮 强化学习 🌊 扩散/Flow 🚗 轨迹规划 📐 策略梯度
JUL 20
自动驾驶论文精读与源码拆解系列
累计 60+ 篇自动驾驶论文精读与多篇代码级讲解,覆盖 VLA、世界模型、端到端、扩散驾驶策略等方向。
项目 论文精读 源码 知识沉淀
JUL 20
论文精读|TruckDrive — 面向重卡的长距离高速公路感知数据集,把感知边界推到 1000 米
TruckDrive 是 Torc Robotics 与普林斯顿大学在 CVPR 2026 提出的面向半挂重卡的高速公路长距离多模态感知数据集,含 47.5 万同步样本、16.5 万密集标注帧,2D 标注延伸到 1000 米、3D 标注延伸到 400 米,配备了 7 台长距 FMCW 激光雷达、10 台 4D 雷达与 11-15 路多焦距相机。本文用大白话拆解其传感器架构(含完整的传感器位置坐标表)、标注流水线、与 nuScenes/ONCE 等数据集的定量对比,并深入分析重卡制动距离公式、高速场景对感知的独特要求(300-500 米安全感知窗口),以及当前 VLA 模型在 150 米处系统性失效的原因。文章还包含感知距离需求对比图、TruckDrive 车辆传感器部署实拍、以及范围分布图等多个可视化素材。
TruckDrive 重卡自动驾驶 高速公路感知 长距离感知 3D检测