论文精读|TruckV2X:首个以重卡为中心的 V2X 车路协同感知数据集,专治盲区与挂车遮挡

TruckV2X (IEEE RA-L 2025) 是首个以半挂重卡为中心的 V2X 多模态多智能体协同感知数据集,用 CARLA 仿真构建 64 个场景、88,396 帧点云、百万图像、118 万 3D 框,覆盖牵引车-挂车-CAV-RSU 四类智能体,系统性揭示重卡因车身长、挂车摆动、转弯内侧盲区而对车路协同的刚需。

2026年7月20日 · 4 分钟 · 755 字 · 

思考|重卡 VLA 是一个巨大的研究空白——兼论 Truck-VLA 架构设计

引言:100 篇 VLA 论文,0 篇属于重卡 如果你关注自动驾驶领域的最新进展,一定注意到 2024-2026 年间 VLA(Vision-Language-Action)模型的爆发式增长。从 AutoVLA、DriveVLM、EMMA、OpenDriveVLA 到 SAMoE-VLA、LaST-VLA、UniDriveVLA,光是 arXiv 上能找到的自动驾驶 VLA 论文就已超过 100 篇。 但这里有一个令人震惊的事实: 这 100+ 篇论文,没有一篇专门针对重卡(heavy-duty truck)场景。 所有模型都在乘用车数据集(nuScenes、Waymo Open Dataset、Bench2Drive、CARLA)上训练和评测。 与此同时,重卡自动驾驶的产业化进程正在加速:Aurora 于 2025 年在德州启动了无安全员的 L4 商业运营,Kodiak AI 已将 VLM 部署在自家卡车感知栈上,Torc Robotics 计划 2027 年量产 L4 卡车。重卡自动驾驶的市场需求是真实且急迫的——美国卡车运输业每年承担着超过 7000 亿美元的货物运输,卡车司机缺口超过 10 万人。然而学术界对重卡 VLA 的研究仍然是一片空白。这不仅是学术上的缺憾,更是产业落地的关键瓶颈。 本文的目标是: 定义这个空白:为什么现有 VLA 方法不能直接迁移到重卡? 分析根本原因:哪些维度造成了迁移障碍? 提出架构方案:Truck-VLA 应该怎么设计? 给出路线图:从哪里开始填补这个空白? 一、VLA 简史:从 VA 到 VLA 的演进 在深入重卡之前,先回顾一下自动驾驶 VLA 的整体图景。 1.1 三个时代 自动驾驶的"感知-决策-控制"管线经历了三个阶段: VA 时代(2016-2023):视觉-动作模型,直接从传感器映射到控制输出。代表工作包括 ALVINN、ChauffeurNet、TransFuser、UniAD、VAD。核心局限是黑盒推理、长尾泛化差、无法理解语言指令。这一时期的模型本质上是"感知→轨迹"的纯回归映射,缺乏显式推理能力。 ...

2026年7月23日 · 12 分钟 · 2451 字 · 

nuPlan数据集详解

一、概述 nuPlan 是由 Motional(原 nuTonomy 团队)于 2023 年发布的大规模自动驾驶规划数据集与闭环仿真评测框架。与 nuScenes 主要聚焦感知任务不同,nuPlan 的设计初衷是填补规划领域三个核心空白:缺乏大规模人类驾驶规划数据、缺乏标准化闭环评测指标、以及缺乏可复现的仿真评估协议。 nuPlan 的核心规模数据:1500 小时的人类驾驶数据,覆盖全球四个城市——波士顿(Boston)、匹兹堡(Pittsburgh)、拉斯维加斯(Las Vegas)和新加坡(Singapore)。这些城市的驾驶环境具有显著差异:波士顿的老城区窄路与不规则交叉口、匹兹堡的丘陵道路与桥梁、拉斯维加斯的宽阔多车道网格化道路、新加坡的右舵驾驶与密集高架路网。 nuPlan 最革命性的贡献在于:它不仅是一个数据集,更是一个完整的闭环仿真平台。研究者可以在 nuPlan 仿真环境中部署自己的规划模型,与不同类型的交通参与者(log-replay 或 reactive agent)交互,并从安全性、合规性和通行效率等多个维度自动评估模型表现。这种"数据+仿真+评估"三位一体的设计,使 nuPlan 成为目前自动驾驶规划领域最全面的基准平台。 二、数据采集与统计 2.1 数据规模对比 维度 nuScenes nuPlan 总驾驶时长 约 5.5 小时 约 1500 小时 场景/Log 数 1000 个 scene 约 1282 个 log 标注关键帧 约 40,000 约 150 万 标注 3D 框总数 约 140 万 约 5900 万 覆盖城市 2(波士顿、新加坡) 4(波士顿、匹兹堡、拉斯维加斯、新加坡) 传感器配置 6 Cam + 5 Radar + 1 LiDAR 同 nuScenes(部分 Log 不同) 高精度地图 无 完整 HD Map(车道拓扑、交通标志) 仿真环境 无 内置闭环仿真器 2.2 四城市特点 波士顿:美国东北部老城,街道较窄且不规则,存在大量无保护左转、两阶段左转和环形交叉口。历史街区的道路拓扑复杂,行人活动频繁。冬季还可能遇到积雪和湿滑路面。波士顿的数据量约占全部数据的 30%。 ...

2026年7月19日 · 4 分钟 · 673 字 · AutoDriving Blog · 

nuScenes数据集详解

一、概述 nuScenes 是由 Aptiv(现 Motional)与 nuTonomy 团队于 2019 年发布的大规模自动驾驶多模态数据集,也是最早提供完整传感器套件标注的全场景数据集之一。它的发布标志着自动驾驶感知研究从单一传感器(仅 LiDAR 或仅 Camera)向多传感器融合的重要转折,极大地推动了 3D 检测、跟踪、预测和规划等多个方向的发展。 nuScenes 包含 1000 个驾驶场景(scene),每个场景时长约 20 秒,步长 20Hz 录制,关键帧以 2Hz 采样标注。数据采集覆盖波士顿和新加坡两个城市——包括城市主干道、居民区、十字路口、环形交叉口、隧道和高速公路等多种路况,以及白天、夜晚、黄昏、雨天等不同光照和天气条件。这种多样性使得基于 nuScenes 训练的模型对光照和天气变化具有更好的鲁棒性。 该数据集的核心价值在于其多模态特性:每辆数据采集车在同一时间戳下同时提供 6 个环视摄像头图像(覆盖 360° 视野)、5 个毫米波雷达点云和 1 个 32 线 Velodyne 激光雷达点云。研究者可以基于这些数据开发真正利用多模态传感器融合的感知算法,也可以分别验证不同传感器配置下算法的性能上限。 二、传感器配置 每一帧数据中,nuScenes 的传感器配置规格与部署位置如下: 2.1 传感器规格 摄像头(Camera):6 个环视摄像头,型号为 Basler ace acA1600-60gc(160 万像素),分别安装于车顶前部(CAM_FRONT)、左前(CAM_FRONT_LEFT)、右前(CAM_FRONT_RIGHT)、左侧(CAM_BACK_LEFT)、右侧(CAM_BACK_RIGHT)和后部(CAM_BACK)。每个摄像头输出 1600×900 像素 RGB 图像,帧率 12Hz,通过硬件同步实现同一时刻的全局快门采集。所有摄像头的水平视野之和覆盖 360°。 激光雷达(LiDAR):1 个 Velodyne HDL-32E 32 线旋转式激光雷达,安装于车顶中心位置,垂直视野范围 -30° 至 +10°(共 40°),水平视野 360°,帧率 20Hz。每帧返回约 80 万个点,波长 905nm,最大探测距离约 100m。点云密度随距离增加而减小,近距离(< 20m)密度最高。 ...

2026年7月19日 · 4 分钟 · 683 字 · AutoDriving Blog ·