RAW2Drive 双流 MBRL 框架:特权流 + 原始传感器流 + 对齐机制(来源:arXiv:2505.16394)

📄 论文信息

  • 标题Raw2Drive: Reinforcement Learning with Aligned World Models for End-to-End Autonomous Driving (in CARLA v2)
  • 团队:上海交通大学, 复旦大学, AgiBot
  • arXiv2505.16394
  • 代码github.com/Thinklab-SJTU/Raw2Drive
  • 收录:NeurIPS 2025
  • 关键词:模型基强化学习, 世界模型, 端到端驾驶, 双流架构, 特权学习
  • 一句话总结RAW2Drive 提出双流 MBRL 方案,先用特权 BEV 信息高效训练世界模型,再通过时空对齐机制指导原始传感器世界模型,成为首个在 CARLA v2 上成功的端到端原始传感器 MBRL 方法。

🤔 要解决什么问题?

端到端自动驾驶的训练范式对比:

范式问题原因
模仿学习(IL)因果混淆 + 分布偏移学的是"专家在做什么"而非"应该做什么"
无模型强化学习(MFRL)样本效率低,难以收敛高维原始观测空间探索极困难
模型基RL(MBRL)仅适用于特权输入原始传感器数据高维冗余,世界模型难以学习

核心问题:能否设计一个 MBRL 框架,使其既能享受 RL 的因果推理优势,又能在原始传感器输入上直接工作?

💡 核心思想

RAW2Drive 的双流方案:

  1. 特权流(Privileged Stream):用 BEV 语义掩码作为输入,高效训练一个特权世界模型和特权策略
  2. 原始传感器流(Raw Sensor Stream):用多视图 RGB 图像作为输入,在对齐机制的引导下学习原始传感器世界模型

关键洞察:低维特权信息的世界模型容易训练,且质量高,可以作为"教师"来引导原始传感器流的学习。

⚙️ 方法细节

整体架构

RAW2Drive 包含四个核心组件:

组件特权流原始传感器流
世界模型RSSM + Encoder/Decoder/Reward/Continue headsRSSM + Encoder/Decoder (仅保留 Decoder)
策略基于世界模型 rollouts 训练基于对齐后的世界模型训练
输入时序 BEV 语义掩码时序多视图 RGB 图像

引导机制(Guidance Mechanism)

引导机制包含三个层次:

1. 时空对齐损失(Spatial-Temporal Alignment Loss): 对齐特权流和原始传感器流的编码状态:

$$ \mathcal{L}_{align} = \|e_t - \hat{e}_t\|^2 $$

其中 $e_t$ 是特权编码状态,$\hat{e}_t$ 是原始传感器编码状态。

2. Reward/Continue 头重用: 原始传感器流的 reward 和 continue 预测头直接使用特权世界模型的参数,避免从零学习困难的价值预测。

3. 动作蒸馏(Action Distillation): 使用特权策略的 rollout 数据填充回放缓冲区,并蒸馏动作分布到原始传感器策略。

为什么去掉原始传感器流的 Reward/Continue 头?

消融实验发现保留这两个头反而有害:

配置DSSR
无 Decoder/Reward/Continue 头17.41.2/10
仅 Decoder83.57.5/10
Decoder + Reward72.15.8/10
Decoder + Continue68.34.9/10
三者全有58.73.6/10

原因:原始视觉数据在相邻帧间高度相似,但 reward 和 continue 信号可能剧烈跳变,网络难以同时学习感知一致性和价值预测。

🧪 实验与结果

Bench2Drive 闭环评估

方法类型DS ↑SR ↑
UniADIL36.21.5/10
VADIL40.82.3/10
DriveTransformerIL72.45.6/10
Think2Drive (privileged)MBRL51.73.1/10
RAW2DriveMBRL (raw)83.57.5/10

多能力评估

能力RAW2DriveDriveTransformer提升
左转72.3%58.1%+14.2%
右转76.8%62.4%+14.4%
直行91.2%85.6%+5.6%
车道保持94.5%91.2%+3.3%
交通灯遵守88.7%76.3%+12.4%
避障71.4%45.8%+25.6%

消融实验

组件DS说明
完整 RAW2Drive83.5
w/o 对齐损失61.2时空状态对齐关键
w/o Reward 头重用74.8价值引导有助
w/o 动作蒸馏68.5特权策略知识重要
w/o 特权流(从头训练)18.3双流方案不可少

⚠️ 局限与未来方向

  • 依赖 CARLA 仿真环境:特权信息(BEV 语义掩码)在真实世界中不可直接获得
  • 两阶段训练复杂度高:需要先训练特权流,再训练原始传感器流
  • 对齐损失对感知质量敏感:如果原始传感器编码质量差,对齐会失效
  • 仅基于视觉输入:未探索 LiDAR 或其他模态

📝 个人思考

RAW2Drive 的双流特权引导方案在思路上与 VAE/蒸馏有亲缘关系——用干净的低维信号引导冗余的高维信号学习。区别在于这是在一个 MBRL 框架内完成的,世界模型不仅要学会"理解现在",还要学会"预测未来"。

最有工程价值的发现是 Reward/Continue 头反而有害。直觉上,给原始传感器世界模型更多的预测头应该帮助学习,但实验证明 decoder-only 的效果最好。这提示我们:原始传感器世界模型的瓶颈是感知质量,而非价值预测——先把"看清楚"的问题解决,再把"判断好坏"的任务交给特权世界模型。

与 NoRD 相比,RAW2Drive 也用了 RL,但目标不同:NoRD 用 RL 优化最终驾驶得分,RAW2Drive 用 RL 学习世界模型内的规划策略。两种 RL 的 VLA 结合方式值得区分。


📖 这是论文精读系列的第 XX 篇。特权知识蒸馏到原始传感器,是通往真实世界 MBRL 的一条务实路径。欢迎留言讨论。