论文精读:Bench2Drive — Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving

现有端到端自动驾驶评测存在开环指标不可靠、长路线闭环方差大、缺乏统一训练集三大问题。Bench2Drive 由上海交通大学提出,是首个面向多维度驾驶能力的闭环评测基准,提供 200 万帧统一标注训练数据与 220 条短路线多技能评估协议。实验表明开环 L2 误差与闭环驾驶分数相关性极弱(Pearson r=0.03),专家特征蒸馏与细粒度能力评估是提升端到端自动驾驶的关键方向。

2026年7月18日 · 4 分钟 · 843 字 · 

论文精读:BEV-VAE — Multi-View Image Generation with Spatial Consistency

现有自动驾驶多视角生成方法缺乏显式3D建模,仅将问题视为2D图像集合成。BEV-VAE提出在BEV隐空间中进行编码与生成,通过多视角VAE构造统一BEV表征,再以DiT进行潜扩散生成。在nuScenes和Argoverse 2上,BEV-VAE实现了高保真重建与3D一致的多视角生成,并支持新视角合成与3D布局可控生成。

2026年7月18日 · 4 分钟 · 801 字 · 

论文精读:TOAD — Test-Time Trajectory Optimization for Autonomous Driving

端到端自动驾驶规划器通常先生成候选轨迹再评分,但评分器无法影响候选集本身,弱候选集会限制性能。TOAD将评分器重新定义为学习到的轨迹级奖励函数,在测试时使用交叉熵方法(CEM)搜索最大化该奖励的轨迹,无需重训练即可即插即用。在NAVSIM-v1(94.7 PDMS)、NAVSIM-v2(56.3 EPDMS)和闭环HUGSIM基准上,TOAD一致提升了六种基规划器的表现,并深入分析了评分器泛化能力对测试时搜索的关键影响。

2026年7月18日 · 5 分钟 · 858 字 · 

论文精读:WorldVLA — Towards Autoregressive Action World Model

WorldVLA 提出统一的自回归动作世界模型,将VLA与世界模型融合在单一LLM框架中。通过三种模态的离散token共享词汇表实现图像/文本/动作的全统一,并提出动作注意力掩码解决长序列动作块的误差累积问题。在LIBERO基准上动作成功率提升4%、FVD降低10%,证实世界模型与动作模型的双向增强。

2026年7月18日 · 4 分钟 · 724 字 · 

论文精读|CLOVER:闭环价值估计与排序框架——端到端自动驾驶规划的生成-打分新范式

端到端自动驾驶规划器的训练(模仿单条轨迹)与评测(规则化指标)存在根本性错配。CLOVER 提出轻量级生成器-打分器架构,通过构造评估器过滤的伪专家轨迹实现集合级覆盖训练,再以保守闭环自蒸馏交替优化生成器与打分器。在 NAVSIM 上达到 94.5 PDMS 和 90.4 EPDMS,刷新 SOTA,并提供了不完备打分器仍能提升生成器的理论保证。

2026年7月18日 · 5 分钟 · 985 字 · 

论文精读|ReWorld — 面向 World Action Model 的表征学习

现有 World Action Model 仅通过输出端损失间接塑造中间表征,导致世界知识无法有效传递到规划模块。ReWorld 首次提出面向自动驾驶 WAM 的表征学习框架,通过未来预测监督、跨模态对齐和硬负样本排斥三个维度直接优化中间表征,在 nuScenes 上将 FVD 从 81.3 降至 61.9(降幅 23.9%),在 NAVSIM 上将闭环 PDMS 从 89.1 提升至 90.4 且无需 RL 后训练。

2026年7月18日 · 5 分钟 · 997 字 · 

论文精读|X-World — 可控多相机世界模型实现可扩展端到端自动驾驶

端到端自动驾驶面临评测成本高、场景覆盖有限、难以复现的瓶颈。X-World 提出了一种以自我为中心的多视角生成式世界模型,通过动作条件化的多相机视频生成实现可控闭环仿真,在动作跟随度、跨视角一致性和长时序稳定性上取得了突破性表现。论文详细设计了两阶段级联训练策略、视角-时序自注意力机制和异构条件注入方案,为 VLA 系统的可扩展闭环评测与仿真训练提供了完整基础设施。

2026年7月18日 · 5 分钟 · 1005 字 ·