技术博客
自动驾驶 VLA · 世界模型 · 端到端 · 前沿论文精读与知识分享
📅 2026
JUL
19
论文精读|DriveDreamer:构建真实驾驶场景的世界模型
DriveDreamer 是首个完全从真实驾驶数据构建的自动驾驶世界模型。它用扩散模型配合 ControlNet 机制处理 HDMap、3D 框、文本和动作等多模态结构化条件,通过两阶段训练同时实现可控驾驶视频生成与未来动作预测。作为驾驶世界模型的奠基之作,它开创了从真实场景理解到未来预测的统一范式。
JUL
19
论文精读|BEVFormer:时空 Transformer 玩转多摄像头 BEV 感知
BEVFormer 开创了基于可学习 BEV queries 的时空 Transformer 感知范式,用空间交叉注意力从多视图图像采样特征、用时间自注意力沿时序聚合信息。它纯靠多摄像头就在 nuScenes 上达到 56.9% NDS 逼近 LiDAR 基线。此后几乎所有端到端驾驶方案都沿用其 BEV query+时序融合的基本设计。
JUL
19
论文精读|Gen-Drive:扩散模型生成 + 强化学习精调的驾驶策略
Gen-Drive 把自动驾驶规划从'预测-规划'重构为'生成-评估'范式:行为扩散模型生成多样未来场景,学习型场景评估器(VLM 辅助训练)打分,再用 RL 微调扩散策略向高分方向优化。它创造性地将 RLHF 奖励建模思路搬进驾驶领域,验证了学习型 reward 优于人工设计。在闭环评测中展现了生成式+强化学习融合的潜力。
JUL
19
知识点拆解|Flow Matching 与扩散模型统一视角:从 SDE 到 ODE 的生成范式
扩散模型与 Flow Matching 是当前生成式 AI 的两大核心范式。本文从 SDE 与 ODE 的统一视角出发,深入讲解扩散模型的随机微分方程解释、Flow Matching 的向量场学习方法、Rectified Flow 的路径整流机制,揭示扩散是 Flow Matching 的特殊情况。同时总结两者在自动驾驶场景生成与轨迹规划中的应用对比。
JUL
19
论文精读|Senna:用 VLM 给端到端驾驶装上'大脑'
Senna 将大型视觉语言模型(Senna-VLM)与端到端规划器(Senna-E2E)解耦协同,VLM 用自然语言输出高层决策,E2E 在该决策条件下生成精确轨迹。它巧妙绕开了 LVLM 不擅长数值预测的软肋,让 VLM 干'说人话做决策'、E2E 干'算轨迹画路点'。这条 VLM 辅助端到端驾驶的路线成为后续多个工作的设计原型。
JUL
19
知识点拆解|条件扩散模型详解:引导方法与条件注入技术
条件生成是扩散模型落地的关键能力,涉及如何将文本、图像、深度图、驾驶命令等条件信息注入生成过程。本文深入讲解 Classifier-Free Guidance 与 Classifier Guidance 的数学原理、条件注入的四种技术方案、驾驶场景中的多模态条件设计,以及截断扩散和 Flow Matching 等加速方案。
JUL
19
论文精读|One-VL:小米统一视觉语言模型
小米 OneVL 用双模态隐式推理超越显式 CoT,攻克了隐式推理长期打不过显式 CoT 的困境。它将 55 个紧致隐 token(35 视觉+20 语言)作为信息瓶颈,用语言解码器还原语义 CoT、视觉世界模型解码器预测未来帧,双管齐下将隐空间钉死在因果关系上。推理时所有隐 token 一步 prefill,延迟与直接出答案持平,4B 模型在四大基准全 SOTA。
JUL
19
知识点拆解|驾驶世界模型全景详解:分类、代表工作与发展脉络
世界模型从预测空间维度可分为像素空间、潜在空间和占用空间三大类别,每种都有不同的代表方法与适用场景。本文系统梳理了 DriveDreamer、GAIA-1、Vista、World4Drive、OccWorld 等主流世界模型,对比其核心技术、条件控制与对规划的支持能力,并给出完整的分类体系与发展脉络。
JUL
19
论文精读|Last-VLA:小米的视觉-语言-动作模型
LaST-VLA 把 VLA 推理从文字 CoT 搬进连续隐空间,用 3D 几何先验(VGGT)和世界模型动力学先验(Cosmos)两个外部基础模型当特征级老师,蒸馏监督隐 CoT。它让隐式推理既绕开了文字 CoT 的慢速与幻觉问题,又避免了朴素隐 CoT 的物理脱节。在 NAVSIM 双榜单上用单目前视传感器取得 SOTA,推理时两个老师全部旁路、零额外开销。
JUL
19
知识点拆解|视频生成模型基础详解:VQVAE、扩散模型与DiT
视频生成模型是自动驾驶世界模型的核心技术基础。本文从 VQVAE 的离散潜在表征出发,逐步讲解扩散模型从像素到潜在空间的演进、DiT 架构的 Scaling 特性、因果 VAE 在时序建模中的作用,以及驾驶场景下的多相机视频生成方法全景。
JUL
19
论文精读|Sparse4D:全稀疏多摄像头 3D 感知的三连击
Sparse4D 用全稀疏范式挑战 BEV 感知路线:用稀疏实例 query 直接从多相机图像抠出 3D 目标,绕开计算昂贵的稠密 BEV 特征图。它通过稀疏 4D 关键点采样、循环时序融合和实例去噪三项核心设计,将多摄像头 3D 检测与跟踪做到 nuScenes 顶尖。作为全稀疏感知范式奠基作,后续 SparseDrive 系列在此基础上构建端到端驾驶系统。
JUL
19
知识点拆解|自动驾驶传感器与多模态融合基础
自动驾驶依赖多传感器融合来克服单一传感器在弱光、雨雪等场景下的能力边界。本文系统对比摄像头、激光雷达、毫米波雷达等主流传感器的原理与优劣,深入讲解时空同步与多模态融合策略。最后阐述 BEV 作为统一表示空间如何串联感知全链路。
JUL
19
知识点拆解|自动驾驶安全机制详解
安全是自动驾驶系统的第一性原则。本文系统梳理端到端自动驾驶中的安全机制设计,涵盖碰撞检测与避障、可行驶区域约束、规则安全过滤器、损失函数中的安全项、安全世界模型、主动安全 ADAS 系统及功能安全标准等核心内容。帮助读者构建从算法安全到系统安全的完整认知框架。
JUL
19
论文精读|AlphaDrive:GRPO 强化学习唤醒驾驶推理与多模态规划
AlphaDrive 把 DeepSeek R1 式的 GRPO 推理强化学习首次引入自动驾驶规划,将高层驾驶决策建模为元动作分类问题。它设计了四个面向规划的专门奖励,配合 SFT 预热+RL 探索两阶段策略。仅 2B 参数的 Qwen2VL 模型反超 7B 系列,并涌现出'一景多解'的多模态规划能力。
JUL
19
知识点拆解|控制基础与车辆动力学
控制模块是自动驾驶系统中连接规划与车辆执行器的关键桥梁。本文深入讲解车辆运动学与动力学基础模型、经典控制方法(PID、LQR、MPC)、轨迹跟踪算法、以及车辆动力学中的关键物理概念。同时分析端到端自动驾驶中控制角色的转变——从传统控制到'waypoint 直接输出'再到'action chunking'的演进逻辑。
JUL
19
知识点拆解|Transformer与注意力机制基础
Transformer 凭借自注意力机制的长程依赖建模与并行计算能力,从 NLP 席卷至自动驾驶全栈。本文从缩放点积注意力的数学原理出发,系统梳理 Multi-Head Attention、ViT、BEVFormer 及 VLM 中 Causal Attention 的关键技术。为理解 Transformer 在自动驾驶感知与规划中的应用奠定理论基础。
JUL
19
论文精读|Diffusion Planner:把轨迹规划重定义为扩散式未来生成
Diffusion Planner 把自动驾驶规划重定义为未来轨迹生成任务,用 Diffusion Transformer(DiT)将自车规划与他车预测联合建模为一次条件去噪过程。它通过免训练的分类器引导机制在推理时灵活注入安全、舒适与速度偏好。在 nuPlan 闭环评测中刷新 SOTA,开创了扩散式联合预测-规划的新范式。
JUL
19
知识点拆解|逆强化学习详解:从专家演示中学会'为什么这么开'
逆强化学习(IRL)解决的是'从行为反推动机'的问题——给定专家演示,推断 driving force 背后的 reward 函数。本文详解最大熵 IRL、GAIL/AIRL 对抗方法,阐明 IRL 与 BC、RL 的本质区别,并梳理 IRL 在自动驾驶中的应用:从人类驾驶数据中学习 reward,再用 RL 优化策略。最后讨论偏好 IRL 和 VLM 作为 reward 的最新趋势。
JUL
19
知识点拆解|扩散模型基础:从DDPM到条件生成
扩散模型通过逐步加噪与逆向去噪实现从纯噪声到高质量数据的生成,已成为 GAN 之后最强大的生成范式。本文从 DDPM 的数学推导出发,详细讲解正向加噪过程、反向去噪网络以及条件生成方法。同时梳理了扩散模型在自动驾驶场景生成、轨迹规划中的数据增强应用全景。
JUL
19
知识点拆解|Scoring-based 规划范式详解
Scoring-based 规划范式是当前端到端自动驾驶规划的主流方法论之一,其核心思想是:先生成多个候选轨迹,再通过学习一个评分网络选出最优轨迹。本文系统性梳理从 BC 回归到多模态评分、扩散采样到强化学习的方法演进,详细解析 Vocabulary-based、动态生成、扩散三类核心范式,并深入 ScoreNet 的设计哲学与关键论文脉络。