论文精读:FeaXDrive — Feasibility-aware Trajectory-Centric Diffusion Planning

FeaXDrive 发现噪声中心扩散规划与轨迹可行性空间存在根本错位,提出轨迹中心扩散框架,通过自适应曲率正则化训练、可行驶区域引导推理和可行性感知 GRPO 后训练系统提升轨迹物理可行性。在 NAVSIM 上达 88.7 PDMS (IL) / 90.0 PDMS (RL),曲率违反率从 8.59% 降至 0.88%。

2026年7月19日 · 4 分钟 · 800 字 · 

论文精读:Hydra-MDP — End-to-end Multimodal Planning with Multi-target Hydra-Distillation

Hydra-MDP 提出多教师知识蒸馏框架,从人类示范教师(模仿人类轨迹)和规则教师(碰撞/可行驶区域等闭环指标)中同时学习,用多头解码器集成多样化轨迹候选。它以端到端可微分的方式统一了模仿学习和闭环指标优化,在 CVPR 2024 Navsim 挑战赛获得第一名,证明了多目标蒸馏范式在驾驶规划中的有效性。

2026年7月19日 · 4 分钟 · 812 字 · 

论文精读:UniDriveVLA — Mixture-of-Transformers 解耦感知-推理冲突的统一驾驶 VLA

UniDriveVLA 提出 Mixture-of-Transformers 架构,通过理解/感知/规划三个专家解耦感知-推理冲突,结合 Masked Joint Attention 与稀疏感知范式,在 nuScenes 开环和 Bench2Drive 闭环上均达到 SOTA。

2026年7月19日 · 6 分钟 · 1115 字 · 

论文精读|AutoDrive-P³:感知-预测-规划链式思维的统一强化微调——ICLR 2026 端到端驾驶新范式

当前 VLM 驾驶方案要么直接输出规划缺失 CoT 推理,要么将感知-预测-规划割裂为独立模块缺乏协同。AutoDrive-P³ 提出统一链式思维框架,通过 P³-CoT 数据集构建感知→预测→规划的结构化推理链,再用 P³-GRPO 算法进行分层渐进式强化微调——将奖励从规划反传到感知和预测模块,实现三模块联合优化。在 NAVSIM 上达到 89.9 EPDMS,nuScenes 上取得最低碰撞率。

2026年7月19日 · 5 分钟 · 951 字 · 

论文精读|DriveFuture:未来感知潜在世界模型——以未来状态条件化当前规划的 SOTA 范式

现有潜在世界模型将未来状态视为预测目标而非规划条件,导致当前与未来特征纠缠。DriveFuture 提出以未来世界状态显式条件化当前决策的框架:训练时用 GT 未来潜在状态做条件,推理时用预测的未来状态接替,实现统一的规划导向 foresight 机制。在 NAVSIM v2 navhard 上以 55.5 EPDMS 排名第一,navtest 上达到 89.9 EPDMS 和 90.7 PDMS。

2026年7月19日 · 6 分钟 · 1222 字 · 

论文精读|Uni-World VLA — 交错世界建模与规划实现闭环交互驾驶

现有世界模型通常先生成完整未来视频再规划(开环想象),但这种方式忽略了规划决策对环境的实时反馈。Uni-World VLA 提出交错生成范式——模型逐帧交替预测未来画面和自车动作,形成世界建模与控制的闭环交互。同时引入单目深度图作为几何线索增强空间感知。在 NAVSIM 上以单目 RGB 达到 89.4 PDMS,超越多传感器融合方法。

2026年7月19日 · 6 分钟 · 1138 字 · 

数据闭环工程:从数据飞轮到持续迭代

数据闭环是自动驾驶系统持续进化的核心引擎,但多数团队卡在「采了很多数据却不会用」的困境。数据闭环的核心难点不在于采集,而在于从PB级数据中精准定位那万分之一的corner case。本文拆解完整数据飞轮(采集→挖掘→标注→训练→评测→回灌),重点介绍主动学习采样策略(熵采样/多样性采样/不确定性估计)、场景库建设方法论、以及基于NeRF/3DGS的自动标注与数据增强前沿实践。

2026年7月19日 · 4 分钟 · 772 字 · 

知识精讲|LiDAR点云处理基础

系统讲解LiDAR工作原理(ToF、机械/固态)、点云表示方法(xyz、intensity、ring)、三类主流点云检测方法(voxel-based、point-based、range-view),以及在端到端检测中的典型方案(CenterPoint、TransFusion-L)。

2026年7月19日 · 3 分钟 · 495 字 · 

知识精讲|相机成像原理与标定

深入讲解自动驾驶中相机成像的核心原理,包括针孔模型、内参外参、畸变模型与标定流程,并分析相机标定质量对BEV感知与3D检测的影响,以及常见车载相机类型。

2026年7月19日 · 3 分钟 · 577 字 · 

知识精讲|自动驾驶定位基础

系统讲解自动驾驶定位技术核心:GNSS/RTK、IMU、车轮里程计的基本原理,卡尔曼滤波的预测-更新过程,多传感器融合的松耦合与紧耦合方案,以及基于HD地图与点云匹配的定位方法,并分析VLA时代定位技术的新角色。

2026年7月19日 · 3 分钟 · 489 字 · 

论文精读:Bench2Drive — Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving

现有端到端自动驾驶评测存在开环指标不可靠、长路线闭环方差大、缺乏统一训练集三大问题。Bench2Drive 由上海交通大学提出,是首个面向多维度驾驶能力的闭环评测基准,提供 200 万帧统一标注训练数据与 220 条短路线多技能评估协议。实验表明开环 L2 误差与闭环驾驶分数相关性极弱(Pearson r=0.03),专家特征蒸馏与细粒度能力评估是提升端到端自动驾驶的关键方向。

2026年7月18日 · 4 分钟 · 843 字 · 

论文精读:BEV-VAE — Multi-View Image Generation with Spatial Consistency

现有自动驾驶多视角生成方法缺乏显式3D建模,仅将问题视为2D图像集合成。BEV-VAE提出在BEV隐空间中进行编码与生成,通过多视角VAE构造统一BEV表征,再以DiT进行潜扩散生成。在nuScenes和Argoverse 2上,BEV-VAE实现了高保真重建与3D一致的多视角生成,并支持新视角合成与3D布局可控生成。

2026年7月18日 · 4 分钟 · 801 字 · 

论文精读:TOAD — Test-Time Trajectory Optimization for Autonomous Driving

端到端自动驾驶规划器通常先生成候选轨迹再评分,但评分器无法影响候选集本身,弱候选集会限制性能。TOAD将评分器重新定义为学习到的轨迹级奖励函数,在测试时使用交叉熵方法(CEM)搜索最大化该奖励的轨迹,无需重训练即可即插即用。在NAVSIM-v1(94.7 PDMS)、NAVSIM-v2(56.3 EPDMS)和闭环HUGSIM基准上,TOAD一致提升了六种基规划器的表现,并深入分析了评分器泛化能力对测试时搜索的关键影响。

2026年7月18日 · 5 分钟 · 858 字 · 

论文精读:WorldVLA — Towards Autoregressive Action World Model

WorldVLA 提出统一的自回归动作世界模型,将VLA与世界模型融合在单一LLM框架中。通过三种模态的离散token共享词汇表实现图像/文本/动作的全统一,并提出动作注意力掩码解决长序列动作块的误差累积问题。在LIBERO基准上动作成功率提升4%、FVD降低10%,证实世界模型与动作模型的双向增强。

2026年7月18日 · 4 分钟 · 724 字 · 

论文精读|CLOVER:闭环价值估计与排序框架——端到端自动驾驶规划的生成-打分新范式

端到端自动驾驶规划器的训练(模仿单条轨迹)与评测(规则化指标)存在根本性错配。CLOVER 提出轻量级生成器-打分器架构,通过构造评估器过滤的伪专家轨迹实现集合级覆盖训练,再以保守闭环自蒸馏交替优化生成器与打分器。在 NAVSIM 上达到 94.5 PDMS 和 90.4 EPDMS,刷新 SOTA,并提供了不完备打分器仍能提升生成器的理论保证。

2026年7月18日 · 5 分钟 · 985 字 · 

论文精读|ReWorld — 面向 World Action Model 的表征学习

现有 World Action Model 仅通过输出端损失间接塑造中间表征,导致世界知识无法有效传递到规划模块。ReWorld 首次提出面向自动驾驶 WAM 的表征学习框架,通过未来预测监督、跨模态对齐和硬负样本排斥三个维度直接优化中间表征,在 nuScenes 上将 FVD 从 81.3 降至 61.9(降幅 23.9%),在 NAVSIM 上将闭环 PDMS 从 89.1 提升至 90.4 且无需 RL 后训练。

2026年7月18日 · 5 分钟 · 997 字 · 

论文精读|X-World — 可控多相机世界模型实现可扩展端到端自动驾驶

端到端自动驾驶面临评测成本高、场景覆盖有限、难以复现的瓶颈。X-World 提出了一种以自我为中心的多视角生成式世界模型,通过动作条件化的多相机视频生成实现可控闭环仿真,在动作跟随度、跨视角一致性和长时序稳定性上取得了突破性表现。论文详细设计了两阶段级联训练策略、视角-时序自注意力机制和异构条件注入方案,为 VLA 系统的可扩展闭环评测与仿真训练提供了完整基础设施。

2026年7月18日 · 5 分钟 · 1005 字 · 

求职面经

这里会分享自动驾驶方向的求职面经和面试准备,敬请期待。

2026年7月17日 · 1 分钟 · 1 字 · 

项目实践

这里记录我做过的自动驾驶相关项目和工程实践。每个项目都附上我承担的工作、成果与对应链接。

2026年7月17日 · 1 分钟 · 1 字 ·