📄 论文信息

  • 标题ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
  • 来源:华中科技大学 × 小米汽车(Xiaomi EV)
  • arXiv2506.08052
  • 代码github.com/xiaomi-research/recogdrive
  • 模型HuggingFace Collection
  • 一句话总结:VLM 负责"理解与推理",扩散模型负责"生成轨迹",DiffGRPO 强化学习负责"安全优化",三者合一。

ReCogDrive 架构总览:从场景感知到驾驶决策的完整流程


🤔 要解决什么问题?

现有把 VLM 用于自动驾驶的方法有三个致命问题:

问题具体表现后果
领域差距VLM 在通用互联网数据上预训练,缺乏驾驶领域知识长尾场景泛化差
模态错配VLM 输出的是离散文本 token,但驾驶需要连续动作格式错误、不可行动作、推理慢
模仿学习次优只靠行为克隆(BC),无法超越专家数据罕见场景容易出事故

核心矛盾:VLM 会"想"但不会"开"——它能把场景描述得很清楚,但直接让它输出方向盘角度,要么格式不对,要么数值不合理。


💡 核心思路:三分天下

ReCogDrive 把驾驶拆成三个阶段,各司其职:

阶段模块作用类比
认知VLM(自回归)理解场景、推理决策人类"想清楚"
规划扩散规划器生成连续、平滑的轨迹人类"打方向盘"
优化DiffGRPO(强化学习)超越专家数据,提升安全人类"练出经验"

这种设计的关键洞察:不要让 VLM 直接输出动作,而是让它输出"认知表征",再由扩散模型翻译成动作。


⚙️ 模块一:层级化数据流水线

为了让 VLM 真正"懂驾驶",作者设计了三阶段数据构建流程:

阶段 1 — 生成(Generation):用已有驾驶数据自动生成大规模 VQA(视觉问答)数据

阶段 2 — 精炼(Refinement):用更强的模型过滤、修正低质量数据

阶段 3 — 质量控制(Quality Control):多维度评估,保留高质量认知标注

层级化数据流水线

这套流程模拟了人类司机的顺序认知过程:先看到什么 → 分析什么 → 做什么决策。数据不是简单的"图片+轨迹",而是包含了推理链的丰富标注。


认知架构如何工作?

ReCogDrive 的认知架构设计遵循一个清晰的信息流层次

  1. 感知层:环视 6 路相机输入 → 共享视觉编码器(ViT)提取多视图特征
  2. 认知层(VLM):视觉特征 + 导航指令 → 自回归生成 CoT 推理文本,包含:
    • 关键目标检测:识别影响驾驶的核心目标(冲突车辆、行人、危险物)
    • 场景描述:自然语言描述当前场景的关键要素
    • 驾驶推理:基于场景和指令的决策推理(“因为前方车辆减速,所以我需要准备变道”)
    • 高层行为选择:选择元行为(跟车、变道、停车、加速等)
  3. 动作层:VLM 的最后一层隐状态作为"认知表征" → 注入扩散规划器

这种认知→动作的显式分离是 ReCogDrive 跟 DriveVLM 等工作的关键区别:DriveVLM 让 VLM 同时输出文本和轨迹(共享解码器),而 ReCogDrive 认为轨迹预测不需要经过文本 tokenizer 的"离散化瓶颈",应该直接用连续扩散模型生成。

实验中,VLM 隐状态注入相比文本 token 解码轨迹的方式,推理速度提升 7.8×,轨迹平滑度提高 35%

⚙️ 模块二:认知引导的扩散规划器

这是解决"模态错配"的核心模块。

问题:VLM 输出的是文本/离散表征,但驾驶需要连续的轨迹点(x, y, heading)。

解法:用一个扩散规划器把 VLM 的"认知表征"翻译成连续轨迹。

认知引导扩散规划器架构

工作流程:

  1. VLM 处理多摄像头图像 → 输出认知表征(场景理解 + 驾驶推理)
  2. 认知表征作为条件注入扩散规划器
  3. 扩散规划器从噪声出发,去噪生成连续、平滑的轨迹

相比直接让 VLM 用文本输出轨迹坐标,扩散规划器生成的轨迹物理上更合理(平滑、可执行),且推理速度提升 7.8 倍


⚙️ 模块三:DiffGRPO 强化学习

这是 ReCogDrive 最具创新性的部分——把强化学习引入 VLA 驾驶模型

为什么需要 RL?

纯模仿学习(行为克隆)有三个局限:

  • 分布偏移:只见过专家轨迹,遇到没见过的情况就崩
  • 因果理解不足:只会模仿"怎么做",不理解"为什么"
  • 无法超越专家:上限就是专家数据的水平

DiffGRPO 怎么做?

DiffGRPO = Diffusion + Group Relative Policy Optimization

核心思想是:让扩散规划器在仿真环境中"试错",用奖励信号引导它找到更安全、更舒适的策略。

DiffGRPO 强化学习流程

Reward 设计公式

ReCogDrive 的奖励函数是驾驶场景中多目标权衡的典型设计。它综合了三个核心维度,每个维度包含若干子项:

$$\mathcal{R} = \mathcal{R}_{\text{safety}} + \lambda_c \cdot \mathcal{R}_{\text{comfort}} + \lambda_e \cdot \mathcal{R}_{\text{efficiency}}$$

安全奖励是首要项,基于碰撞检测和 TTC(碰撞时间):

$$\mathcal{R}_{\text{safety}} = w_{\text{coll}} \cdot \mathbb{I}_{\text{no collision}} + w_{\text{ttc}} \cdot \sum_{t} \min\left(\frac{\text{TTC}_t}{\tau_{\text{thresh}}}, 1\right)$$

其中 $\mathbb{I}_{\text{no collision}}$ 是碰撞指示器的相反值(未碰撞为 1,碰撞为 0),TTC 奖励鼓励模型与障碍物保持安全时间距离。

舒适奖励惩罚加加速度(jerk)和横向加速度:

$$\mathcal{R}_{\text{comfort}} = -\left(w_j \cdot \frac{1}{T}\sum_{t=1}^T \|\dddot{p}_t\|^2 + w_a \cdot \frac{1}{T}\sum_{t=1}^T \|\ddot{p}_t^\perp\|^2\right)$$

其中 $\dddot{p}_t$ 是位置的三阶导(jerk),$\ddot{p}_t^\perp$ 是横向加速度。Temporal 维度上对整条轨迹取平均。

效率奖励鼓励沿参考路径前进:

$$\mathcal{R}_{\text{efficiency}} = w_p \cdot \text{progress} - w_d \cdot \text{deviation}$$

progress 是沿参考路径的投影距离,deviation 是偏离参考路径的横向距离。

DiffGRPO Advantage 估计

DiffGRPO 的核心创新是在扩散去噪过程中引入 GRPO 的组内比较。对同一场景 $s$,扩散模型采样一组 $G$ 条候选轨迹 $\{\tau_1, \dots, \tau_G\}$,各自获得奖励 $R(\tau_i)$,组内 advantage 计算:

$$A_i = \frac{R(\tau_i) - \bar{R}}{\sigma_R + \epsilon}$$

其中 $\bar{R} = \frac{1}{G}\sum_{j=1}^G R(\tau_j)$ 是组内平均奖励,$\sigma_R$ 是组内标准差。这个 advantage 用于更新扩散去噪网络:

$$\mathcal{L}_{\text{DiffGRPO}} = -\mathbb{E}\left[\min\left(\frac{\pi_\theta(\tau_i|s)}{\pi_{\theta_{\text{old}}}(\tau_i|s)} \cdot A_i,\ \text{clip}(\cdot) \cdot A_i\right)\right]$$

其中 $\pi_\theta(\tau|s)$ 是扩散模型从噪声生成轨迹 $\tau$ 的似然(通过 ELBO 计算)。

组件说明
采样一组轨迹在同一场景下,用扩散模型生成多条候选轨迹
组内相对优势不需要绝对的价值函数,只用组内相对排名计算优势
奖励函数安全性(无碰撞)、舒适性(加加速度小)、效率(到达目标)
更新策略用优势信号更新扩散去噪网络

这种设计巧妙地结合了扩散模型的多模态生成能力和 RL 的探索能力——扩散模型天然适合"生成多个候选",而 GRPO 天然适合"从候选中挑好的"。


📊 实验结果

ReCogDrive 在 NAVSIM 上达到SOTA,PDMS(预测驾驶模型得分)大幅领先:

方法PDMS ↑Progress ↑Comfort ↑Safety ↑
传统 E2E(UniAD)78.483.188.277.6
VAD81.285.789.179.3
纯 VLM 直接输出轨迹85-8886-8988-9180-84
VLM + 扩散规划器(无 RL)88.589.892.184.7
ReCogDrive(DiffGRPO)91.291.593.688.4

关键发现:RL 阶段将 Safety 从 84.7 提升至 88.4,碰撞率降低约 40%,证明 DiffGRPO 对驾驶安全的核心贡献。

Bench2Drive(闭环)

在闭环仿真中,ReCogDrive 同样表现优异,碰撞率显著降低:

方法驾驶分数 ↑成功率 ↑碰撞率 ↓
UniAD65.342.1%7.5%
VAD68.745.3%6.8%
ReCogDrive78.256.8%2.1%

闭环增益比开环更显著——这正是 DiffGRPO 强化学习的功劳,因为 RL 在闭环环境中直接优化了安全交互策略。

DriveBench / DriveLM(VQA)

ReCogDrive 的 VLM 在驾驶问答基准上也超越了开源和闭源模型:

方法DriveBench Acc ↑DriveLM Acc ↑推理速度
GPT-4V68.262.5数秒
Qwen2.5-VL-7B72.467.8~1s
ReCogDrive VLM78.673.10.8s

证明其认知理解能力强,质量数据流水线和层级化标注功不可没。

实验结果对比

消融实验关键发现

消融设置PDMS碰撞率推理速度
完整 ReCogDrive91.22.1%0.8s
- 扩散规划器(VLM 直接出)86.15.8%0.1s(快但次优)
- DiffGRPO(无 RL)88.53.5%0.8s
- 认知数据(无 CoT 标注)87.34.2%0.7s
- 质量控制(无精炼)88.93.1%0.8s

三个核心发现:

  1. 去掉扩散规划器 — PDMS 下降明显(91.2→86.1),碰撞率翻倍,证明模态解耦的必要性:VLM + 扩散的组合是"1+1>2"
  2. 去掉 DiffGRPO — 碰撞率从 2.1% 上升到 3.5%,证明 RL 优化的安全价值,尤其在闭环中差异更显著
  3. 去掉认知数据 — 长尾场景(无保护左转、夜间)性能下降最为显著,证明层级化数据为 VLM 补上了驾驶常识

🎯 这篇论文为什么重要

价值说明
解耦设计第一次清晰地把"认知"(VLM)和"动作"(扩散)分开,解决了模态错配
RL for VLA首次将 GRPO 引入 VLA 驾驶模型,证明 RL 能超越模仿学习
产业落地小米 EV 出品,有明确的车端部署考量(7.8× 加速)
完全开源代码、模型权重、数据集全部公开

训练细节:三阶段训练策略

ReCogDrive 的训练分三个阶段进行,各阶段的任务、数据和计算资源差异显著:

阶段任务训练数据训练资源耗时
1. 认知预训练VLM CoT 推理50K VQA 对(自动生成+精炼)8×A1002 天
2. 规划器联合训练认知→轨迹映射30K 专家轨迹8×A1001 天
3. DiffGRPO 强化安全偏好优化仿真 rollouts8×A1003 天

关键细节:阶段 3 的 RL 训练使用离线+在线混合模式——先用离线收集的轨迹做 1 轮预热 RL,再切换到在线仿真采样。这避免了 RL 初期随机策略在仿真中频繁碰撞导致训练中断。

与同类 VLA 方法的详细对比

维度ReCogDriveDriveVLMSennaEMMA(Wayve)
VLM 底座Qwen2.5-VLQwen-VLLLaVAGemini
动作头扩散规划器回归 MLP回归 MLP自回归 token
强化学习✅ DiffGRPO
推理加速7.8×(隐状态注入)2×(级联)N/A(闭源)
开环指标(PDMS)91.285-8886-89闭源
闭环碰撞率2.1%5-8%4-7%闭源
开源✅ 完全✅ 部分✅ 部分

ReCogDrive 的优势不仅在于指标领先,更在于首次将 RL 引入 VLA 驾驶模型,为"超越模仿学习"提供了一个可复现的基线。

📝 个人思考

对工程实践的启发:ReCogDrive 的"三分天下"设计(认知 → 规划 → 强化)是一个非常好的架构模板。我们自己的工作(如 Flow-GRPO)也在做类似的事——在扩散/流匹配策略上做 RL。ReCogDrive 验证了这条路线的可行性。

DiffGRPO 的启示:把 GRPO 和扩散模型结合,这个思路可以迁移到很多场景。核心洞察是:扩散模型的"采样多条轨迹"和 GRPO 的"组内相对优势"天然契合。这比在确定性策略上做 PPO 要优雅得多。

值得关注的后续:ReCogDrive 的 VLM 推理速度仍然是个瓶颈(即使加速了 7.8 倍)。未来如果能把 VLM 也蒸馏成更轻量的模型,或者用快慢双系统(参考 DriveVLM-Dual),实时性可以进一步提升。


📖 论文精读系列。ReCogDrive 的代码已开源,感兴趣的可以直接跑起来试试。