论文精读|World4Drive:用意图感知的物理隐世界模型,摆脱感知标注做端到端规划

World4Drive 是首个将多模态驾驶意图与物理隐世界模型结合的端到端框架,无需 3D 框/高精地图等昂贵感知标注。它借 Grounded-SAM 的语义先验和 Metric3D 的深度先验构建’懂物理’的隐空间,让模型在多种驾驶意图下想象未来、用世界模型打分选最优轨迹。L2 误差降 18.1%、碰撞率降 46.7%、收敛快 3.75 倍,被 ICCV 2025 收录。

2026年7月19日 · 5 分钟 · 951 字 · 

论文精读|PARA-Drive:完全并行的端到端架构,把感知预测规划"同时跑"

PARA-Drive 系统性地探索了端到端模块化自动驾驶的设计空间,提出完全并行的架构——感知、预测、规划模块同时训练、同时推理,互不依赖。在 nuScenes 上 L2 误差降低 28.8%、碰撞率降低 43.3%,推理速度提升近 3 倍,被 CVPR 2024 接收。

2026年7月30日 · 10 分钟 · 2003 字 · 

论文精读|VLA for Autonomous Driving:自动驾驶视觉-语言-动作模型的过去、现在与未来

这份 47 页的综述首次为自动驾驶 VLA 建立了系统形式化与分类法,从 VA(视觉-动作)到 VLA(视觉-语言-动作)理清演进线。它提出端到端 VLA 与双系统 VLA 两大范式分类,并统一梳理了动作空间四分法、数据集基准与评测协议。是当前自动驾驶 VLA 领域最权威的架构脉络地图和未来挑战指南。

2026年7月19日 · 6 分钟 · 1207 字 · 

论文精读|TruckV2X:首个以重卡为中心的 V2X 车路协同感知数据集,专治盲区与挂车遮挡

TruckV2X (IEEE RA-L 2025) 是首个以半挂重卡为中心的 V2X 多模态多智能体协同感知数据集,用 CARLA 仿真构建 64 个场景、88,396 帧点云、百万图像、118 万 3D 框,覆盖牵引车-挂车-CAV-RSU 四类智能体,系统性揭示重卡因车身长、挂车摆动、转弯内侧盲区而对车路协同的刚需。

2026年7月20日 · 4 分钟 · 755 字 · 

论文精读:DiffusionDriveV2 — RL-Constrained Truncated Diffusion

DiffusionDriveV2 将强化学习引入截断扩散模型,提出 Intra-Anchor GRPO 和 Inter-Anchor Truncated GRPO,解决了 DiffusionDrive 中多样性与一致高质量之间的根本矛盾。在 NAVSIM v1 上达到 91.2 PDMS,v2 上达到 85.5 EPDMS,均创下新纪录。

2026年7月19日 · 5 分钟 · 920 字 · 

论文精读|ACT + ALOHA:低成本双臂遥操作与动作分块策略

ACT+ALOHA 用不到 2 万美元的开源双臂遥操作平台解决了精细双臂操控的数据获取难题。ACT 采用动作分块(Action Chunking)+CVAE Transformer 的抗复合误差策略,将模仿学习精度推至新高度。ALOHA 的低成本同构主从机械臂设计为具身智能数据采集建立了新范式。

2026年7月19日 · 3 分钟 · 441 字 · 

论文精读:Longitudinal Safety Distance Control Considering Cargo Load(ICVES 2025)——RSS 安全距离模型为什么漏算了满载重卡的刹车

ICVES 2025 论文 Longitudinal Safety Distance Control Considering Cargo Load for Autonomous Heavy-Duty Vehicles 指出经典 RSS 安全距离模型假设车辆质量恒定,忽略了货物载荷,导致满载重卡制动距离更长、RSS 给出的安全距离不足而撞车。本文从 RSS 公式出发,讲清质量/载荷如何修正制动距离,并呼应博客 nuTruck 一文:现有 benchmark 不把质量/动力学安全作为指标。

2026年7月20日 · 5 分钟 · 1013 字 · 

RiskWorld 论文精读:以目标为中心的潜在世界模型,用于自动驾驶风险识别

北航 × 中关村实验室 RiskWorld 精读:不用「全局想象未来帧」,而是为每个周围目标单独跑一遍「如果它继续运动会怎样」的 RSSM 潜在动力学推演,从中解码出目标级风险评分。RiskBench 上 F1=63.0%、误报率仅 2.1%,在「谁是风险源」这个精准定位问题上超过了所有基线。

2026年9月7日 · 7 分钟 · 1436 字 · 

论文精读|TransDiffuser:去相关多模态表示驱动的扩散式轨迹生成

LiAuto 提出 TransDiffuser,用多模态表示去相关(Decorrelation)解决扩散轨迹生成中的模式坍缩问题。核心思路是强制多模态条件特征的维度去相关,让条件信号更丰富地覆盖潜空间,从而无需任何锚点轨迹或场景先验即可生成多样化轨迹。ResNet-34 + LiDAR 配置在 NAVSIM 上达到 PDMS 94.85。本文将用一张图一张图对应讲解的方式,把这篇论文的动机、架构、核心创新全部讲清楚。

2026年7月22日 · 5 分钟 · 968 字 · 

论文精读:Drive-JEPA — Video JEPA 预训练 + 多模态轨迹蒸馏的端到端驾驶

Drive-JEPA(2026)指出端到端驾驶的两个瓶颈:(1) 视频世界模型预训练收益有限;(2) 每场景只有一条人类轨迹,多模态监督稀缺。它用 V-JEPA(而非生成式世界模型)在 208 小时驾驶视频上自监督预训练 ViT 编码器,得到规划对齐的表征;再用基于仿真器的「多模态轨迹蒸馏」把多样伪教师轨迹蒸馏进 proposal-centric 规划器,并以动量感知选择抑制帧间抖动。NAVISIM v1 达 93.3 PDMS、v2 达 87.8 EPDMS 双榜 SOTA,仅前视相机+轻量 transformer 即在无感知设定下超此前 SOTA 3 PDMS。

2026年7月20日 · 3 分钟 · 489 字 · 

论文精读:GTRS — 通用轨迹评分(CVPR25 自动驾驶挑战赛冠军)

GTRS(NVIDIA, CVPR 2025 自动驾驶挑战赛 E2E 赛道冠军)指出:现有轨迹评分器要么打「静态大词表」要么打「动态小候选」,两者都泛化差。GTRS 用三根支柱统一二者:(1) 扩散策略生成细粒度动态候选;(2) 在 16384 的超密集词表上训练评分器 + 词表 dropout,使推理时能在更小子集上强泛化;(3) 传感器旋转增强 + top-k 细化自蒸馏,提升域外鲁棒性。Navhard 榜 EPDMS 最高 49.4,逼近依赖真值感知的 PDM-Closed。

2026年7月20日 · 2 分钟 · 314 字 · 

论文精读:WoTE — 用 BEV 世界模型做在线轨迹评估的端到端驾驶

WoTE(ICCV 2025, CASIA)指出:端到端规划器只生成轨迹却「盲目」选轨迹,缺少对未来后果的预判。它用一个 BEV 空间世界模型,给每条候选轨迹 rollout 出未来 BEV 状态,再由奖励模型打分挑最高奖励者。BEV 空间比图像级世界模型省算力,且能直接用 nuPlan 等 BEV 仿真器提供监督。NAVISIM 达 88.3 PDMS,Bench2Drive 闭环 Driving Score 61.71 创 SOTA。

2026年7月20日 · 3 分钟 · 521 字 · 

论文精读|Anti-rollover APF — 用五自由度动力学 + 侧翻排斥势场,让重卡规划阶段就避开翻车

本文精读 Jin 与 He 在 2024 年 Chinese Journal of Mechanical Engineering 发表的 Anti-rollover Artificial Potential Field Motion Planning Method of an Autonomous Heavy Truck Optimised by Game Theory。论文用 5-DOF 重卡动力学模型推导侧翻指标,提出把侧翻排斥势场(anti-rollover APF)融入 MPC 运动规划,并用博弈论优化势场权重,让重卡在规划阶段就同时兼顾避障与防侧翻。面向刚入行的 VLA 工程师,用大白话讲清侧翻机理、LTR 判据、五自由度模型与势场规划框架,并呼应博客 nuTruck 文章。

2026年7月20日 · 4 分钟 · 817 字 · 

论文精读|TruckDrive — 面向重卡的长距离高速公路感知数据集,把感知边界推到 1000 米

TruckDrive 是 Torc Robotics 与普林斯顿大学在 CVPR 2026 提出的面向半挂重卡的高速公路长距离多模态感知数据集,含 47.5 万同步样本、16.5 万密集标注帧,2D 标注延伸到 1000 米、3D 标注延伸到 400 米,配备了 7 台长距 FMCW 激光雷达、10 台 4D 雷达与 11-15 路多焦距相机。本文用大白话拆解其传感器架构(含完整的传感器位置坐标表)、标注流水线、与 nuScenes/ONCE 等数据集的定量对比,并深入分析重卡制动距离公式、高速场景对感知的独特要求(300-500 米安全感知窗口),以及当前 VLA 模型在 150 米处系统性失效的原因。文章还包含感知距离需求对比图、TruckDrive 车辆传感器部署实拍、以及范围分布图等多个可视化素材。

2026年7月20日 · 6 分钟 · 1178 字 · 

论文精读:FeaXDrive — Feasibility-aware Trajectory-Centric Diffusion Planning

FeaXDrive 发现噪声中心扩散规划与轨迹可行性空间存在根本错位,提出轨迹中心扩散框架,通过自适应曲率正则化训练、可行驶区域引导推理和可行性感知 GRPO 后训练系统提升轨迹物理可行性。在 NAVSIM 上达 88.7 PDMS (IL) / 90.0 PDMS (RL),曲率违反率从 8.59% 降至 0.88%。

2026年7月19日 · 4 分钟 · 800 字 · 

论文精读:Hydra-MDP — End-to-end Multimodal Planning with Multi-target Hydra-Distillation

Hydra-MDP 提出多教师知识蒸馏框架,从人类示范教师(模仿人类轨迹)和规则教师(碰撞/可行驶区域等闭环指标)中同时学习,用多头解码器集成多样化轨迹候选。它以端到端可微分的方式统一了模仿学习和闭环指标优化,在 CVPR 2024 Navsim 挑战赛获得第一名,证明了多目标蒸馏范式在驾驶规划中的有效性。

2026年7月19日 · 4 分钟 · 812 字 · 

论文精读:UniDriveVLA — Mixture-of-Transformers 解耦感知-推理冲突的统一驾驶 VLA

UniDriveVLA 提出 Mixture-of-Transformers 架构,通过理解/感知/规划三个专家解耦感知-推理冲突,结合 Masked Joint Attention 与稀疏感知范式,在 nuScenes 开环和 Bench2Drive 闭环上均达到 SOTA。

2026年7月19日 · 6 分钟 · 1115 字 · 

论文精读|AutoDrive-P³:感知-预测-规划链式思维的统一强化微调——ICLR 2026 端到端驾驶新范式

当前 VLM 驾驶方案要么直接输出规划缺失 CoT 推理,要么将感知-预测-规划割裂为独立模块缺乏协同。AutoDrive-P³ 提出统一链式思维框架,通过 P³-CoT 数据集构建感知→预测→规划的结构化推理链,再用 P³-GRPO 算法进行分层渐进式强化微调——将奖励从规划反传到感知和预测模块,实现三模块联合优化。在 NAVSIM 上达到 89.9 EPDMS,nuScenes 上取得最低碰撞率。

2026年7月19日 · 5 分钟 · 951 字 · 

论文精读|DriveFuture:未来感知潜在世界模型——以未来状态条件化当前规划的 SOTA 范式

现有潜在世界模型将未来状态视为预测目标而非规划条件,导致当前与未来特征纠缠。DriveFuture 提出以未来世界状态显式条件化当前决策的框架:训练时用 GT 未来潜在状态做条件,推理时用预测的未来状态接替,实现统一的规划导向 foresight 机制。在 NAVSIM v2 navhard 上以 55.5 EPDMS 排名第一,navtest 上达到 89.9 EPDMS 和 90.7 PDMS。

2026年7月19日 · 6 分钟 · 1222 字 · 

论文精读|Uni-World VLA — 交错世界建模与规划实现闭环交互驾驶

现有世界模型通常先生成完整未来视频再规划(开环想象),但这种方式忽略了规划决策对环境的实时反馈。Uni-World VLA 提出交错生成范式——模型逐帧交替预测未来画面和自车动作,形成世界建模与控制的闭环交互。同时引入单目深度图作为几何线索增强空间感知。在 NAVSIM 上以单目 RGB 达到 89.4 PDMS,超越多传感器融合方法。

2026年7月19日 · 6 分钟 · 1138 字 ·