论文精读|DiffusionDrive:扩散模型驱动的端到端轨迹规划

DiffusionDrive 将扩散模型引入自动驾驶轨迹规划,从噪声出发逐步去噪生成多条合理轨迹,解决了确定性回归的 mode averaging 痛点。它通过轨迹初始化先验和截断扩散策略大幅减少采样步数,让扩散规划真正跑在车端。在闭环评测中达到生成式端到端驾驶的领先水平。

2026年7月19日 · 3 分钟 · 573 字 · 

论文精读|ReCogDrive:小米EV强化认知端到端自动驾驶框架

华科×小米EV 提出 ReCogDrive,将 VLM 认知推理(场景理解与决策分析)、扩散规划器(连续轨迹生成)和 DiffGRPO 强化学习(安全优化)三阶段统一。它的层级化数据流水线自动生成含推理链的 VQA 标注,解决了 VLM’会想但不会开’的模态错配问题。在 NAVSIM 和 Bench2Drive 上达到 SOTA,验证了’认知-规划-优化’三分天下的 VLA 设计范式。

2026年7月19日 · 3 分钟 · 629 字 · 

论文精读|Qwen-Drive-1.0:阿里通义首个驾驶视觉-语言基础模型

Qwen-Drive-1.0 基于 Qwen3.5-4B VLM 外挂两个模块:BEV感知头(3D检测+占用预测+地图分割)和 Planning Expert(~1.1B 参数 Flow Matching 轨迹生成器),四阶段渐进训练。关键设计:不设推理时打分器,直接用 Flow Matching 单次采样输出轨迹,RL 后训练用 GRPO 式分组优势优化。NAVSIM v1.1 榜上 90.7 PDMS(RL),WOD-E2E 7.91 RFS,AlpaSim 闭环 0.37 分。

2026年9月6日 · 12 分钟 · 2448 字 · 

论文精读|SparseOccVLA:稀疏占用查询桥接 Occupancy 与 VLM,实现统一 4D 场景理解与规划

SparseOccVLA 用稀疏占用查询作为视觉与语言之间的单一桥梁,彻底摆脱 ViT patch token,让 LLM 在统一框架内同时完成场景理解、占用预测和轨迹规划。在 OmniDrive-nuScenes 上 CIDEr 提升 7%,Occ3D-nuScenes mIoU 提升 0.5,nuScenes 规划指标达 SOTA。

2026年7月27日 · 4 分钟 · 806 字 · 

论文精读|Qwen-VLA:阿里通义千问统一视觉-语言-动作基础模型

阿里 Qwen-VLA 用’认知主干+运动专家’双模块解耦架构(类比大脑皮层与小脑分工),将操作、导航、轨迹预测三类异构具身决策问题统一进同一模型。它采用 T2A→CPT→SFT→RL 四阶段渐进训练策略,稳定解决预训练 VLM 与随机初始化 DiT 动作解码器的不对称训练问题。在多机器人本体和多任务家族上展现一致跨任务性能与强分布外泛化。

2026年7月19日 · 3 分钟 · 610 字 · 

论文精读|CARLA: An Open Urban Driving Simulator —— 自动驾驶仿真的事实标准

CARLA 是首个从头构建、开源开放的城市场景驾驶仿真器,基于 Unreal Engine 4 实现了高保真渲染、灵活传感器配置和标准化基准评测。本文从架构设计、实验基准到历史影响全面拆解这篇 CoRL 2017 经典论文,并分析其如何成为自动驾驶研究的事实标准平台。

2026年7月18日 · 9 分钟 · 1745 字 · 

论文精读|RT-1:Robotics Transformer——大规模真实机器人数据驱动的策略学习

RT-1是Google Robotics团队提出的一种基于Transformer的机器人策略模型,通过在超过13万条真实机器人轨迹数据上训练,实现了对700+种任务的强大泛化能力。该工作首次证明了大规模、多样化的真实数据结合高容量架构能够在机器人领域取得类似NLP和CV领域的scalable性能。

2026年7月28日 · 3 分钟 · 456 字 · 

论文精读|EMMA:Waymo的多模态端到端驾驶大模型

Waymo 的 EMMA 基于 Gemini 多模态大模型,把所有驾驶任务(感知、预测、规划)统一翻译成自然语言 VQA,用单一模型、一套语言空间端到端处理。它选择直接文本化坐标以最大化复用 Gemini 预训练的世界知识。代表了将 MLLM 作为驾驶系统’一等公民’的前沿探索。

2026年7月19日 · 3 分钟 · 486 字 · 

论文精读|PaLM-E:具身多模态语言模型——让机器人理解真实世界

PaLM-E是Google与柏林工业大学联合提出的具身多模态语言模型,将PaLM大语言模型与视觉编码器结合,直接处理机器人传感器数据。该模型在562B参数规模下不仅在机器人任务上表现出色,还在OK-VQA等视觉语言基准上达到SOTA,同时保留了强大的语言能力。

2026年7月28日 · 2 分钟 · 363 字 · 

论文精读|GoalFlow:目标引导流匹配轨迹生成

GoalFlow 用一个精准目标点词表加评分机制选出最合理的短期终点,再用 Flow Matching 一步生成多模态驾驶轨迹。它解决了纯扩散生成轨迹发散无边界、而固定锚点约束过强不真实的两难问题。在 NAVSIM 上 PDMS 达到 90.3,验证了’目标点+整流流’高效生成方案的有效性。

2026年7月19日 · 3 分钟 · 509 字 · 

论文精读|SayCan:让大型语言模型在机器人上落地执行

SayCan是Google提出的将大型语言模型与机器人技能结合的方法,通过将LLM的语言知识与机器人技能的可行性(affordance)结合,实现了自然语言指令到长horizon机器人任务的规划与执行。该工作首次展示了LLM如何在真实机器人上落地,开启了LLM+机器人的新范式。

2026年7月28日 · 3 分钟 · 580 字 · 

论文精读|VAD:向量化端到端自动驾驶的效率革命

VAD 将整个驾驶场景建模为全向量化表示——地图元素和 agent 运动都变成矢量,彻底抛弃了 UniAD 中的稠密栅格。它通过隐式 query 交互和显式三个向量化规划约束,在保持精度的同时将推理速度提升 2.5-9.3 倍。作为 UniAD 之后最重要的效率改进工作,VAD 为端到端驾驶的实时部署铺平了道路。

2026年7月19日 · 3 分钟 · 446 字 · 

论文精读|Gato:DeepMind的通用智能体——一个网络玩转604种任务

Gato是DeepMind提出的通用智能体,通过在604种不同任务上联合训练,用一个Transformer网络同时处理 Atari 游戏、机器人控制、图像描述、文本对话等任务。它证明了单一模型可以掌握多种模态的技能,是迈向通用人工智能的重要一步。

2026年7月28日 · 4 分钟 · 805 字 · 

论文精读|DriveVLM-W0 与 DriveWLM 系列:世界模型如何点亮驾驶大模型

DriveVLM 家族从语言 CoT 演进到世界模型统一建模范式,攻克了 VLM 上车面临的监督稀疏、世界与动作割裂、探索不安全三道坎。DrivingGPT 用 VQ-VAE 把图像与动作离散化为统一词表,将驾驶建模为 next-token 预测。DriveVLM-RL 借鉴神经科学双通路机制,用离线 RL 为驾驶安全兜底。

2026年7月19日 · 5 分钟 · 1065 字 · 

论文精读|Open X-Embodiment:跨机器人大规模数据集与RT-X模型

Open X-Embodiment是Google联合21家机构打造的跨机器人大规模数据集,包含22种机器人、100万+轨迹数据。基于该数据集训练的RT-X模型首次证明了跨机器人正迁移的可行性,RT-1-X成功率提升50%,RT-2-X泛化能力提升3倍。

2026年7月28日 · 2 分钟 · 340 字 · 

论文精读|Diffusion Planner:把轨迹规划重定义为扩散式未来生成

Diffusion Planner 把自动驾驶规划重定义为未来轨迹生成任务,用 Diffusion Transformer(DiT)将自车规划与他车预测联合建模为一次条件去噪过程。它通过免训练的分类器引导机制在推理时灵活注入安全、舒适与速度偏好。在 nuPlan 闭环评测中刷新 SOTA,开创了扩散式联合预测-规划的新范式。

2026年7月19日 · 3 分钟 · 581 字 · 

论文精读|DROID:大规模真实世界机器人操作数据集

DROID是Google联合18家机构打造的大规模真实世界机器人操作数据集,包含76k演示轨迹、564个场景、86个任务,跨越北美、亚洲、欧洲三大洲。实验证明使用DROID训练的策略在性能和泛化能力上平均提升20%。

2026年7月28日 · 2 分钟 · 314 字 · 

论文精读|MAN TruckScenes — 第一个面向重卡自动驾驶的多模态数据集,把 4D 雷达做成 360° 全覆盖

MAN TruckScenes 是 MAN Truck & Bus 与慕尼黑工业大学在 NeurIPS 2024 Datasets & Benchmarks 提出的第一个面向自动驾驶重卡的多模态数据集,含 747 个 20 秒场景、4 相机 + 6 激光雷达 + 6 个 4D 雷达 + 双 IMU + 高精度 GNSS,标注范围超 230 米、27 个物体类、34 个场景标签,并首次提供 360° 覆盖的 4D 雷达点云与带 3D 框标注,配套 nuScenes 格式 devkit 与 CenterPoint/RadarGNN/PETR 基线。本文面向刚入行的 VLA 工程师,用大白话拆解它的传感器布局、卡车特有挑战、标注与切分、以及给端到端重卡模型带来的长距离鲁棒感知问题。

2026年7月20日 · 4 分钟 · 776 字 · 

论文精读|AlphaDrive:GRPO 强化学习唤醒驾驶推理与多模态规划

AlphaDrive 把 DeepSeek R1 式的 GRPO 推理强化学习首次引入自动驾驶规划,将高层驾驶决策建模为元动作分类问题。它设计了四个面向规划的专门奖励,配合 SFT 预热+RL 探索两阶段策略。仅 2B 参数的 Qwen2VL 模型反超 7B 系列,并涌现出’一景多解’的多模态规划能力。

2026年7月19日 · 5 分钟 · 889 字 · 

论文精读|RH20T:面向拟人全身控制的机器人操作数据集

RH20T是上海交通大学推出的超大规模机器人操作数据集,包含110,000+条接触丰富的真实世界操作序列,覆盖147项任务、7种机器人配置。数据集提供视觉、力觉、音频等多模态信息,支持一次性模仿学习研究。

2026年7月28日 · 2 分钟 · 352 字 ·