技术博客

自动驾驶 VLA · 世界模型 · 端到端 · 前沿论文精读与知识分享

📅 2026
JUL 19
前沿VLA模型全景速览:从RT-2到GR-3
VLA模型从2023年的RT-2到2026年的GR-3经历了三代演进。本文系统对比15+主流VLA模型的核心设计选择:动作表征(tokenization/连续控制/扩散策略)、视觉编码器架构、LLM backbone选择、以及训练范式(预训练→指令微调→RLHF)。重点分析pi0的Flow Matching动作头、GR-3的CoT推理与自回归架构、BridgeVLA的桥接监督等前沿技术路线。
🤖 VLA 🏭 产业实践 🚗 自动驾驶 🧠 大模型 📊 模型对比
JUL 19
仿真器搭建与闭环测试:从CARLA到SIL/HIL
仿真测试是自动驾驶安全验证的核心手段,但搭建一套好用的仿真测评系统远比想象中复杂。本文讲解主流仿真器的选型对比(CARLA/MetaDrive/NVIDIA Isaac Sim/AlpaSim)、传感器仿真与渲染管线、SIL(Software-in-the-Loop)与HIL(Hardware-in-the-Loop)测试架构、场景编辑器构建与参数化场景生成、以及大规模并行仿真与回归测试的工程落地经验。
🏭 产业实践 🚗 自动驾驶 🎮 CARLA 🔬 仿真测试 ⚙️ SIL/HIL
JUL 19
场景理解与Failure Analysis:定位自动驾驶的边界
自动驾驶系统的每次路测都会产生大量bad case,如何从海量数据中系统化地分析模型失败的根因是一项关键工程能力。本文讲解failure analysis的方法论框架:场景分类taxonomy(感知失败/预测失败/规划失败/控制失败)、故障归因的ablation策略、场景还原与仿真复现、长尾场景的systematic discovery(基于聚类/基于异常检测/基于对抗搜索)、以及建立持续性的bad case追踪与回归防御体系。
🏭 产业实践 🚗 自动驾驶 🔍 Failure Analysis 📊 场景分类 🛡️ 回归防御
JUL 19
ROS/ROS2入门:自动驾驶中的通信中间件
ROS/ROS2是自动驾驶和机器人领域的行业标准中间件,但研究新手往往低估了它的重要性。本文从发布-订阅模型出发,讲解ROS2的核心概念(node/topic/service/action)、DDS通信中间件的QoS策略(reliability/durability/deadline)、TF坐标树与消息同步、rosbag的数据录制与回放,以及自动驾驶系统中常用的消息类型栈(sensor_msgs/nav_msgs/visualization_msgs)。
🏭 产业实践 🚗 自动驾驶 🔧 ROS2 📡 DDS ⚙️ 中间件
JUL 18
论文精读|X-World — 可控多相机世界模型实现可扩展端到端自动驾驶
端到端自动驾驶面临评测成本高、场景覆盖有限、难以复现的瓶颈。X-World 提出了一种以自我为中心的多视角生成式世界模型,通过动作条件化的多相机视频生成实现可控闭环仿真,在动作跟随度、跨视角一致性和长时序稳定性上取得了突破性表现。论文详细设计了两阶段级联训练策略、视角-时序自注意力机制和异构条件注入方案,为 VLA 系统的可扩展闭环评测与仿真训练提供了完整基础设施。
VLA 世界模型 端到端自动驾驶 视频生成 可控生成
JUL 18
论文精读|ReWorld — 面向 World Action Model 的表征学习
现有 World Action Model 仅通过输出端损失间接塑造中间表征,导致世界知识无法有效传递到规划模块。ReWorld 首次提出面向自动驾驶 WAM 的表征学习框架,通过未来预测监督、跨模态对齐和硬负样本排斥三个维度直接优化中间表征,在 nuScenes 上将 FVD 从 81.3 降至 61.9(降幅 23.9%),在 NAVSIM 上将闭环 PDMS 从 89.1 提升至 90.4 且无需 RL 后训练。
世界模型 表征学习 WAM Flow Matching 自动驾驶规划
JUL 18
论文精读|CLOVER:闭环价值估计与排序框架——端到端自动驾驶规划的生成-打分新范式
端到端自动驾驶规划器的训练(模仿单条轨迹)与评测(规则化指标)存在根本性错配。CLOVER 提出轻量级生成器-打分器架构,通过构造评估器过滤的伪专家轨迹实现集合级覆盖训练,再以保守闭环自蒸馏交替优化生成器与打分器。在 NAVSIM 上达到 94.5 PDMS 和 90.4 EPDMS,刷新 SOTA,并提供了不完备打分器仍能提升生成器的理论保证。
VLA 端到端自动驾驶 规划 树搜索 价值估计
JUL 18
论文精读:WorldVLA — Towards Autoregressive Action World Model
WorldVLA 提出统一的自回归动作世界模型,将VLA与世界模型融合在单一LLM框架中。通过三种模态的离散token共享词汇表实现图像/文本/动作的全统一,并提出动作注意力掩码解决长序列动作块的误差累积问题。在LIBERO基准上动作成功率提升4%、FVD降低10%,证实世界模型与动作模型的双向增强。
VLA 世界模型 自回归模型 动作世界模型 统一框架
JUL 18
论文精读:TOAD — Test-Time Trajectory Optimization for Autonomous Driving
端到端自动驾驶规划器通常先生成候选轨迹再评分,但评分器无法影响候选集本身,弱候选集会限制性能。TOAD将评分器重新定义为学习到的轨迹级奖励函数,在测试时使用交叉熵方法(CEM)搜索最大化该奖励的轨迹,无需重训练即可即插即用。在NAVSIM-v1(94.7 PDMS)、NAVSIM-v2(56.3 EPDMS)和闭环HUGSIM基准上,TOAD一致提升了六种基规划器的表现,并深入分析了评分器泛化能力对测试时搜索的关键影响。
VLA 端到端自动驾驶 规划 轨迹优化 测试时优化
JUL 18
论文精读:BEV-VAE — Multi-View Image Generation with Spatial Consistency
现有自动驾驶多视角生成方法缺乏显式3D建模,仅将问题视为2D图像集合成。BEV-VAE提出在BEV隐空间中进行编码与生成,通过多视角VAE构造统一BEV表征,再以DiT进行潜扩散生成。在nuScenes和Argoverse 2上,BEV-VAE实现了高保真重建与3D一致的多视角生成,并支持新视角合成与3D布局可控生成。
BEV VAE 多视角生成 空间一致性 3D感知
JUL 18
论文精读:Bench2Drive — Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving
现有端到端自动驾驶评测存在开环指标不可靠、长路线闭环方差大、缺乏统一训练集三大问题。Bench2Drive 由上海交通大学提出,是首个面向多维度驾驶能力的闭环评测基准,提供 200 万帧统一标注训练数据与 220 条短路线多技能评估协议。实验表明开环 L2 误差与闭环驾驶分数相关性极弱(Pearson r=0.03),专家特征蒸馏与细粒度能力评估是提升端到端自动驾驶的关键方向。
基准评测 Bench2Drive 闭环评测 端到端自动驾驶 NeurIPS 2024
JUL 18
论文精读|CARLA: An Open Urban Driving Simulator —— 自动驾驶仿真的事实标准
CARLA 是首个从头构建、开源开放的城市场景驾驶仿真器,基于 Unreal Engine 4 实现了高保真渲染、灵活传感器配置和标准化基准评测。本文从架构设计、实验基准到历史影响全面拆解这篇 CoRL 2017 经典论文,并分析其如何成为自动驾驶研究的事实标准平台。
🚗 仿真器 🏎️ CARLA 🤖 自动驾驶 🧪 基准评测 🔬 端到端驾驶
JUL 18
BEV 感知技术详解:自动驾驶的鸟瞰图视角
BEV 感知将多摄像头画面统一重投影到以自车为中心的鸟瞰图空间,解决了透视图像到度量空间的根本矛盾。本文详细讲解 LSS 与 Transformer 两条主流视角变换路线,以及 BEVFormer 等代表方法的架构设计。BEV 已是现代端到端自动驾驶感知系统的事实标准中间表示。
🗺️ BEV 👁️ 感知 📷 多摄像头 🚗 自动驾驶
JUL 18
Flow Matching 入门详解:从扩散模型到连续动作生成(含代码讲解)
Flow Matching 通过直接学习从噪声到数据的直线 ODE 路径,解决了扩散模型弯曲路径导致采样步数过多的问题。本文从数学直觉出发讲解向量场、ODE 与流的核心概念,并对比 CFM、Rectified Flow、OT路径等关键变体。与普通教程不同的是,本文所有代码均来自 ByteDance Bagel / Flow-GRPO 的真实项目实现,包含 CFG 推理、SDE 采样、GRPO 策略优化等工业级代码讲解。
🌊 Flow Matching 🎨 扩散模型 📐 数学基础 🤖 动作生成 💻 代码讲解
JUL 18
论文精读|UniAD:面向规划的端到端自动驾驶框架(CVPR 2023最佳论文)
UniAD 首次将感知、预测、规划全部统一进一个可端到端联合训练的网络,以规划为最终目标反向驱动所有中间任务。它开创了显式端到端新范式,每个模块输出可解释的中间表示,并通过规划导向的联合优化全面提升系统一致性。获 CVPR 2023 最佳论文奖,是自动驾驶端到端路线里程碑式的奠基工作。
🔗 端到端 🏆 CVPR 2023 👁️ 感知 📐 规划 🚗 自动驾驶
JUL 18
论文精读|π0:基于Flow Matching的通用视觉-语言-动作模型
π0 用预训练 VLM 做大脑、Flow Matching 做动作头,开创了 VLA 模型动作头设计的第三条路线。Flow Matching 相比扩散采样步数更少、训练更简单,相比离散化精度更高,巧妙弥合了 VLM 与连续机器人控制之间的表征鸿沟。在迄今最大规模机器人数据集上训练,一个模型搞定从叠衣服到收桌子的多种高难度操作。
🤖 VLA 🌊 Flow Matching 🦾 机器人 🧠 具身智能
JUL 17
端到端自动驾驶:从模块化到一体化的演进
端到端自动驾驶将传感器输入直接映射到控制输出,消除了模块化方案中的误差累积与信息瓶颈问题。本文梳理从隐式端到端到显式端到端再到生成式大模型的三代架构演进,对比 UniAD、VAD、VLA 等代表性方案。为理解这一技术路线提供了完整的历史脉络与趋势展望。
🔗 端到端 ⚡ E2E 👁️ 感知 📐 规划 🚗 自动驾驶
JUL 17
什么是世界模型(World Model)?
世界模型让 AI 在脑中预演未来,学习现实世界的物理规律与交通规则后生成逼真的驾驶场景。本文对比生成式(像素空间预测)与表征式(潜在空间预测)两大流派各自的哲学与优劣。世界模型是解决自动驾驶真实数据稀缺与长尾场景覆盖的核心基础设施。
🔮 世界模型 🎨 生成模型 🚗 自动驾驶 📊 数据驱动
JUL 17
什么是 VLA(Vision-Language-Action)模型?
VLA 模型将视觉理解、语言推理和动作执行统一到一个端到端网络中,引入大语言模型的常识推理能力解决自动驾驶长尾场景问题。本文剖析其视觉编码器、LLM 与动作头的标准三组件架构,以及从 LLaVA、RT-2、DriveVLM 到 VLA 的完整演进路线。VLA 正成为后端到端时代自动驾驶的新技术范式。
🧠 VLA 👁️ VLM 🤖 大模型 🚗 自动驾驶
JUL 17
论文精读|DriveVLM:把大语言模型推理能力搬上自动驾驶
DriveVLM 是首个系统性地把视觉语言模型用于自动驾驶场景理解与推理的工作。它提出双系统架构——VLM 慢系统做思维链推理输出高层决策,传统规划器快系统做安全执行。在 CARLA 闭环评测中大幅超越基线,为 VLA 的 Dual-System 范式奠定基础。
👁️ VLM 🧠 VLA 📄 DriveVLM 🚗 自动驾驶 💡 场景理解