技术博客
自动驾驶 VLA · 世界模型 · 端到端 · 前沿论文精读与知识分享
📅 2026
JUL
19
知识点拆解|Chain-of-Thought 推理详解:让 VLA 学会'先思考再行动'
CoT(思维链)让 VLA '想清楚再做',将驾驶决策过程拆解为可解释的推理步骤。本文从 CoT 基础(Few-shot / Zero-shot / Self-consistency)出发,详解 DriveVLM 的场景描述→预测→推理→规划四阶段 CoT、WCog-VLA 的博弈论 Game-CoT、视觉 DCoT,以及 GRPO + CoT 联合训练的 AlphaDrive 范式。
JUL
19
论文精读|DriveVLM-W0 与 DriveWLM 系列:世界模型如何点亮驾驶大模型
DriveVLM 家族从语言 CoT 演进到世界模型统一建模范式,攻克了 VLM 上车面临的监督稀疏、世界与动作割裂、探索不安全三道坎。DrivingGPT 用 VQ-VAE 把图像与动作离散化为统一词表,将驾驶建模为 next-token 预测。DriveVLM-RL 借鉴神经科学双通路机制,用离线 RL 为驾驶安全兜底。
JUL
19
知识精讲|Occupancy网络详解
Occupancy 网络通过稠密的 3D 体素网格表示场景,突破了 3D 目标检测对“物体”范畴的限制,可表征任意形状的障碍物与自由空间。本文详解其与检测的差异、OccFormer/FlashOcc/OpenOccupancy 等代表架构,以及在 NIFF 等世界模型中 occupancy 如何作为核心场景表示驱动未来预测与规划决策。
JUL
19
知识点拆解|运动预测与行为预测基础
运动预测与行为预测是自动驾驶系统理解周围交通参与者的核心技术,其目标是从历史观测中推断其他车辆、行人、骑行者的未来轨迹。本文从问题定义出发,系统梳理输入输出范式、经典架构、多智能体预测、目标条件预测以及评分机制,并分析预测模块在端到端框架中的演进趋势。
JUL
19
知识点拆解|强化学习基础:从MDP到PPO
强化学习通过试错交互自主优化策略,是继监督学习之后最具潜力的自动驾驶训练范式。本文从 MDP 五元组出发,系统讲解策略梯度、PPO/SAC/DDPG 等主流 RL 算法的数学原理与演进脉络。并深入分析各算法在自动驾驶决策与规划中的适用场景与落地挑战。
JUL
19
知识点拆解|多模态对齐与指令微调详解:从 VLM 到 VLA 的关键桥梁
多模态对齐是 VLA 的'关键桥梁'——它决定视觉信号能否被 LLM 正确理解。本文梳理从对比损失(CLIP)到 Q-Former(BLIP-2)到 MLP 投影(LLaVA)的对齐方案演进,以及 VLA 如何将对齐从'图像→文本'扩展到'图像→动作',详解连续动作的 tokenization 策略。
JUL
19
知识点拆解|RLHF 与偏好对齐详解:从大模型到自动驾驶驾驶风格学习
RLHF 通过人类偏好反馈将模型行为对齐到人类期望。本文详解 RLHF 三阶段流程、Bradley-Terry 奖励模型、DPO 直接偏好优化,并分析 GRPO 如何避免显式 reward 建模。在驾驶场景中,偏好对齐天然适配'不同人有不同驾驶风格'这一人类直觉——有人偏好激进、有人偏好保守,RLHF 让 VLA 模型学会按需生成驾驶行为。
JUL
19
论文精读|VAD:向量化端到端自动驾驶的效率革命
VAD 将整个驾驶场景建模为全向量化表示——地图元素和 agent 运动都变成矢量,彻底抛弃了 UniAD 中的稠密栅格。它通过隐式 query 交互和显式三个向量化规划约束,在保持精度的同时将推理速度提升 2.5-9.3 倍。作为 UniAD 之后最重要的效率改进工作,VAD 为端到端驾驶的实时部署铺平了道路。
JUL
19
知识精讲|3D目标检测全景详解
3D 目标检测是自动驾驶感知的核心任务之一。本文从 2D 检测到 3D 检测的额外挑战出发,系统梳理纯视觉、纯 LiDAR 和多传感器融合三大技术路线,分析 DETR3D、BEVFormer、PointPillars、BEVFusion 等代表方法,并探讨在端到端趋势下 3D 检测逐渐被规划吸收的范式转变。
JUL
19
知识点拆解|自动驾驶轨迹规划基础
轨迹规划是自动驾驶系统中连接预测与控制的枢纽,其核心任务是在安全、舒适、可行的约束下生成时空轨迹。本文深入讲解 Frenet 坐标系、主流轨迹规划算法分类、碰撞检测与轨迹平滑等核心概念。帮助读者建立从数学基础到工程实践的完整知识框架。
JUL
19
知识点拆解|离线强化学习详解:从 CQL、IQL 到自动驾驶 VLA
离线 RL 让智能体从静态数据集中学习,无需在线交互,对自动驾驶等安全关键领域至关重要。本文详解 CQL、IQL、TD3+BC 等核心算法,讨论分布偏移与 OOD 动作问题,并梳理离线预训练→在线微调范式在 VLA 驾驶模型中的应用与趋势。
JUL
19
知识点拆解|大语言模型基础详解:Transformer、MoE 与 Scaling Law
LLM 是 VLA 的'大脑',提供推理与常识能力。本文深入 Transformer decoder 架构(因果注意力、KV Cache、RoPE、SwiGLU、GQA)、MoE(DeepSeek-V3 风格)、Scaling Laws 以及 VLA 中常用的 LLM 系列(Qwen-2.5、InternLM、Llama-3)。
JUL
19
论文精读|GoalFlow:目标引导流匹配轨迹生成
GoalFlow 用一个精准目标点词表加评分机制选出最合理的短期终点,再用 Flow Matching 一步生成多模态驾驶轨迹。它解决了纯扩散生成轨迹发散无边界、而固定锚点约束过强不真实的两难问题。在 NAVSIM 上 PDMS 达到 90.3,验证了'目标点+整流流'高效生成方案的有效性。
JUL
19
NVIDIA DRIVE平台详解:从Orin到Thor
NVIDIA DRIVE是自动驾驶行业最主流的车端计算平台,从Orin(254 TOPS)到Thor(2000 TOPS)的演进正在重新定义VLA模型的部署边界。本文从硬件架构出发,讲解Orin/Thor的GPU-CPU-DLA-PVA异构计算单元、内存带宽与瓶颈分析、DRIVE OS与DriveWorks中间件栈、TensorRT在DRIVE上的优化策略(INT8稀疏化/DLA offloading/Multi-Stream调度),以及实际部署VLA模型时的pipeline编排与延迟预算分配经验。
JUL
19
知识精讲|视觉基础模型在自动驾驶中的应用
DINOv2、SAM、Depth Anything、CLIP 等视觉基础模型正在深刻重塑自动驾驶的技术栈。本文详解它们各自的核心能力——自监督特征、可提示分割、单目深度估计、视觉-语言对齐——并分析在 VLA 和世界模型论文中作为冻结主干、教师模型和伪标签生成器的三种主要使用范式。
JUL
19
知识点拆解|自动驾驶强化学习中的 Reward 函数设计详解
Reward 函数决定了驾驶强化学习的性能天花板,必须在安全、舒适、合规、效率之间艰难权衡。本文系统拆解 reward 设计的四大组件(安全、舒适、合规、效率)、三大范式与常见陷阱。同时梳理了 NAVSIM、nuPlan 等评测指标如何反哺 reward 设计,为驾驶 RL 提供实操指南。
JUL
19
知识点拆解|VLM 视觉语言模型入门详解:从 CLIP 到 GPT-4V
VLM(视觉语言模型)是 VLA 的视觉理解基础。本文从 CLIP 奠基到 GPT-4V/Gemini 前沿,系统梳理架构演进(ViT → Q-Former → LLM)、训练三阶段(对齐→指令微调→RLHF)及驾驶 VLM 的适配方案。
JUL
19
知识点拆解|PPO 算法深度拆解:从 Policy Gradient 到 GRPO 的进化之路
PPO 通过 clipped surrogate objective 和 GAE 实现稳定策略更新,是 RLHF 时代的核心算法。本文从 REINFORCE 出发,拆解 PPO 的每个关键组件,并对比 GRPO 的革新——去掉 critic,用组内相对优势替代。最后梳理 PPO/GRPO 在 VLA 驾驶模型(AlphaDrive、ReCogDrive、DriveVLA-W0)中的应用。
JUL
19
论文精读|EMMA:Waymo的多模态端到端驾驶大模型
Waymo 的 EMMA 基于 Gemini 多模态大模型,把所有驾驶任务(感知、预测、规划)统一翻译成自然语言 VQA,用单一模型、一套语言空间端到端处理。它选择直接文本化坐标以最大化复用 Gemini 预训练的世界知识。代表了将 MLLM 作为驾驶系统'一等公民'的前沿探索。
JUL
19
功能安全入门:ISO 26262与SOTIF
L4自动驾驶的部署必须满足功能安全标准,但AI研究人员对此往往一片空白。本文从ISO 26262的ASIL等级与HARA分析出发,讲解功能安全的核心概念(故障/失效/危险/风险/安全目标/安全状态),再深入到SOTIF(ISO 21448)——专门针对自动驾驶'已知不安全场景'和'未知不安全场景'的安全分析框架。重点讨论VLA模型中感知不确定性量化、降级策略(degradation strategy)和安全监控(safety monitor)的工程实践。