个人思考|自动驾驶技术全景学习指南:从基础到前沿的六范式知识体系

一份面向自动驾驶从业者的全景式学习指南。系统梳理六大技术范式(端到端E2E、VLA、世界模型、Scoring规划、JEPA、RL+生成)的核心概念、代表工作、联系脉络和知识依赖。附自测清单和推荐阅读路线,帮助你定位自己的知识短板。

2026年7月27日 · 11 分钟 · 2255 字 · 

论文精读|DriveVLM:把大语言模型推理能力搬上自动驾驶

DriveVLM 是首个系统性地把视觉语言模型用于自动驾驶场景理解与推理的工作。它提出双系统架构——VLM 慢系统做思维链推理输出高层决策,传统规划器快系统做安全执行。在 CARLA 闭环评测中大幅超越基线,为 VLA 的 Dual-System 范式奠定基础。

2026年7月17日 · 3 分钟 · 557 字 · 

什么是 VLA(Vision-Language-Action)模型?

VLA 模型将视觉理解、语言推理和动作执行统一到一个端到端网络中,引入大语言模型的常识推理能力解决自动驾驶长尾场景问题。本文剖析其视觉编码器、LLM 与动作头的标准三组件架构,以及从 LLaVA、RT-2、DriveVLM 到 VLA 的完整演进路线。VLA 正成为后端到端时代自动驾驶的新技术范式。

2026年7月17日 · 4 分钟 · 689 字 · 

VLA大模型训练技巧:混合精度×梯度检查点×序列并行

训练VLA模型远远不止’用DeepSpeed跑起来’这么简单,当模型规模从7B增长到70B参数时,显存瓶颈和通信开销会逼你深入理解每一个训练技巧的原理和trade-off。本文从混合精度训练(FP16 vs BF16 vs FP8的精度缩放策略)、梯度检查点(selective checkpointing vs full checkpointing vs recomputation profiling)、activation offloading(CPU offloading vs NVMe offloading)、序列并行(Ring Attention + sequence parallelism + context parallelism)四个核心技巧展开,配合VLA特有的多模态编码器训练优化,给出实用的训练配置建议与常见调优诊断方法。

2026年7月19日 · 24 分钟 · 5050 字 · 

论文精读|DriveVLA-M0:失败感知的记忆增强,让 VLA 学会吃一堑长一智

DriveVLA-M0 给 VLA 自动驾驶加上了’失败记忆’:离线把模型表现差的场景连同路网/交互结构特征写进 latent memory,在线用专用的 Retrieve Model 检索结构相似的失败案例,再用解耦 LoRA 做测试时训练(TTT)逐场景纠正,让模型’吃一堑长一智’。NAVSIMv1 上 94.1 PDMS、NAVSIMv2 上 47.0 EPDMS,TTT 后向开销仅 26.44ms。它与同系 DriveVLA-W0 走了完全相反的路:W0 用世界模型换’稠密监督’,M0 用失败记忆换’场景自适应’。

2026年8月19日 · 7 分钟 · 1305 字 · 

论文精读|AutoVLA:用自适应推理与 GRPO 微调统一「思考」与「动作」的端到端 VLA

AutoVLA(NeurIPS 2025, UCLA)把「链式推理 CoT」与「物理动作 token 化」塞进同一个自回归生成模型,用一套代码本把连续轨迹离散成可行动作,再用 SFT 训练出快思考(只出轨迹)与慢思考(带 CoT 推理)双模式,最后用 GRPO 强化微调在简单场景关掉多余推理。它是 NAVSIM v1 上 VLA 路线的代表基线(PDMS 89.1 / 92.1+锚点),也是 DriveVLA-W0 的主要对比对象。

2026年7月20日 · 2 分钟 · 393 字 · 

论文精读|DriveVLA-W0:世界模型放大自动驾驶数据缩放律

DriveVLA-W0 用世界模型给 VLA 大模型补上稠密监督,解决了大参数模型仅用稀疏轨迹信号训练的’监督赤字’问题。它同时预测未来动作和未来图像,用像素级稠密监督逼模型学懂物理动力学。单目前视相机即刷新 NAVSIM 榜单,证明了’世界模型放大数据缩放律’的路线可行性。

2026年7月19日 · 7 分钟 · 1308 字 · 

论文精读|Percept-WAM:把 2D/3D 感知'种'进 VLM 里的感知增强世界动作模型

Percept-WAM 回答的是 WAM 系列的另一个致命问题:VLM 的空间感太差——‘定位漂移、时序不一致、置信度虚高’,导致 VLA 系统的感知和规划都不稳。它把 2D/3D 感知任务直接’种’进单个 VLM 里:用 World-PV token(透视视角)和 World-BEV token(鸟瞰视角)编码可定位的世界状态,配合网格条件化预测头、IoU 校准置信度和并行自回归解码,再用四组点级 query(Q_pv/Q_bev/Q_ego/Q_full)把感知表示对齐成轨迹。NAVSIM v1 拿到 90.2 PDMS,超过 DiffusionDrive 2.1,还配了流式推理把时延压到 707ms。

2026年8月19日 · 7 分钟 · 1480 字 · 

论文精读|BrainWAM:大脑式'动作空间协调'——把 VLA 语义先验和 WAM 预测动态拧成一股绳

BrainWAM 用’大脑分工’的思路回答一个根本问题:VLA(语义推理)和 WAM(预测动态)到底该怎么结合?它先诊断出 Tri-MoT 朴素融合的致命伤——语义 token 抢占注意力、压垮预测信号;再受左右脑半球经胼胝体通信、小脑协调运动意图的启发,把语义和预测拆成两条特化通路,各自产出’面向动作’的表示,最后在紧凑的动作空间里用 CAB(胼胝体动作桥)双向交换、CIF(小脑意图融合)协调解码。NAVSIM v1 拿到 89.5 PDMS、v2 拿到 89.6 EPDMS,双双超过 VLA-only、WAM-only 和 Tri-MoT。

2026年8月19日 · 9 分钟 · 1852 字 · 

论文精读|ReCogDrive:小米EV强化认知端到端自动驾驶框架

华科×小米EV 提出 ReCogDrive,将 VLM 认知推理(场景理解与决策分析)、扩散规划器(连续轨迹生成)和 DiffGRPO 强化学习(安全优化)三阶段统一。它的层级化数据流水线自动生成含推理链的 VQA 标注,解决了 VLM’会想但不会开’的模态错配问题。在 NAVSIM 和 Bench2Drive 上达到 SOTA,验证了’认知-规划-优化’三分天下的 VLA 设计范式。

2026年7月19日 · 3 分钟 · 629 字 · 

论文精读|Qwen-Drive-1.0:阿里通义首个驾驶视觉-语言基础模型

Qwen-Drive-1.0 基于 Qwen3.5-4B VLM 外挂两个模块:BEV感知头(3D检测+占用预测+地图分割)和 Planning Expert(~1.1B 参数 Flow Matching 轨迹生成器),四阶段渐进训练。关键设计:不设推理时打分器,直接用 Flow Matching 单次采样输出轨迹,RL 后训练用 GRPO 式分组优势优化。NAVSIM v1.1 榜上 90.7 PDMS(RL),WOD-E2E 7.91 RFS,AlpaSim 闭环 0.37 分。

2026年9月6日 · 12 分钟 · 2448 字 · 

论文精读|Qwen-VLA:阿里通义千问统一视觉-语言-动作基础模型

阿里 Qwen-VLA 用’认知主干+运动专家’双模块解耦架构(类比大脑皮层与小脑分工),将操作、导航、轨迹预测三类异构具身决策问题统一进同一模型。它采用 T2A→CPT→SFT→RL 四阶段渐进训练策略,稳定解决预训练 VLM 与随机初始化 DiT 动作解码器的不对称训练问题。在多机器人本体和多任务家族上展现一致跨任务性能与强分布外泛化。

2026年7月19日 · 3 分钟 · 610 字 · 

论文精读|Last-VLA:小米的视觉-语言-动作模型

LaST-VLA 把 VLA 推理从文字 CoT 搬进连续隐空间,用 3D 几何先验(VGGT)和世界模型动力学先验(Cosmos)两个外部基础模型当特征级老师,蒸馏监督隐 CoT。它让隐式推理既绕开了文字 CoT 的慢速与幻觉问题,又避免了朴素隐 CoT 的物理脱节。在 NAVSIM 双榜单上用单目前视传感器取得 SOTA,推理时两个老师全部旁路、零额外开销。

2026年7月19日 · 4 分钟 · 665 字 · 

论文精读|Teaching VLA Models What to See and Where to Look:DriveTeach-VLA 的视觉教学三段式

DriveTeach-VLA 指出驾驶 VLA 的瓶颈不在语言推理而在视觉空间 grounding,核心问题不是’想不清’而是’看不对’。它提出三段式视觉教学管线——DVD 蒸馏教模型’看什么’、2D 轨迹引导提示教’往哪看’、TGP-guided GRPO 教’怎么动’——层层递进注入驾驶感知先验。在 Qwen2.5-VL 上刷新 NAVSIM 与 nuScenes 双榜单 SOTA。

2026年7月19日 · 4 分钟 · 818 字 · 

论文精读|From Foundation to Application: Improving VLA Models in Practice(LingBot-VLA 2.0)

蚂蚁 LingBot-VLA 2.0 在数据、动作空间、预测建模三个维度同时补课:6 万小时多本体预训练数据覆盖 9 种构型,全身自由度动作空间支持头部/腰部/底盘/灵巧手协同控制,双查询蒸馏赋予模型向前看的预测能力。Token 级稀疏 MoE 动作专家有效解耦多本体异构动力学。在 GM-100 双臂基准与长程移动操作上全面领先 π0.5。

2026年7月19日 · 4 分钟 · 850 字 · 

论文精读|ABot-M0.5:统一的移动操作世界动作模型

ABot-M0.5 用’三层对齐’策略重新设计了移动操作的世界动作模型:潜在动作模块在帧级粒度捕捉视觉状态转移,解决时间粒度粗糙导致的精细接触丢失。双层 Mixture-of-Transformers 解耦导航与操作的动作空间,dream-forcing 训练策略打通训练与推理的分布鸿沟。在长程任务和精细控制上同时达到 SOTA。

2026年7月19日 · 4 分钟 · 674 字 · 

论文精读|LingBot-VLA:务实的 VLA 基础模型

LingBot-VLA 以’务实’为核心设计哲学,用 9 种双臂构型、约 2 万小时真机数据训出一个跨平台 VLA 基础模型。它通过跨构型预训练学出与具体硬件解耦的动作策略,辅以开源高效代码库(8 卡 261 样本/秒)和 GM-100 基准。在 4 个平台 100 类任务上展现强泛化能力,将 VLA 从论文模型推向产线工具。

2026年7月19日 · 4 分钟 · 818 字 · 

CoWorld-VLA精读:多专家世界模型中的自动驾驶推理

CoWorld-VLA 在 VLM 隐空间中构建多专家 Latent CoT 推理框架,解决了文本 CoT 丢失空间信息而隐空间缺乏可条件化信号的根本矛盾。它通过语义交互、几何结构、动态演化与轨迹意图四种专家 Token,将互补的世界知识编码为显式可用的规划条件。在 NAVSIM v1 上达到 89.8 PDMS,证明了结构化隐式推理的有效性。

2026年7月19日 · 3 分钟 · 559 字 · 

RT-2精读:VLA奠基之作——将网络知识迁移到机器人控制

RT-2 由 Google DeepMind 提出,首次将互联网预训练的 VLM 通过动作编码为文本 Token 的方式转化为 VLA 模型。它开创性地用机器人数据微调大规模图文模型,让网络知识迁移到具身控制,使机器人具备语义理解和零样本泛化能力。在 6k 次真机试验中验证了涌现的语义推理和从未见过的任务执行能力,是 VLA 范式的奠基之作。

2026年7月19日 · 2 分钟 · 320 字 · 

VLA-World精读:统一预测想象与反思推理的视觉-语言-行动世界模型

VLA-World 通过将 VLA 的推理能力与世界模型的预测想象统一在单一框架中,实现了预测-生成-反思-规划的完整闭环。它利用动作驱动的可行轨迹引导下一帧图像生成,再对自生成的未来帧进行推理以修正轨迹,在 nuScenes 的规划和生成基准上均达到 SOTA。

2026年7月19日 · 6 分钟 · 1160 字 ·