
📄 论文信息
- 标题:Raw2Drive: Reinforcement Learning with Aligned World Models for End-to-End Autonomous Driving (in CARLA v2)
- 团队:上海交通大学, 复旦大学, AgiBot
- arXiv:2505.16394
- 代码:github.com/Thinklab-SJTU/Raw2Drive
- 收录:NeurIPS 2025
- 关键词:模型基强化学习, 世界模型, 端到端驾驶, 双流架构, 特权学习
- 一句话总结:RAW2Drive 提出双流 MBRL 方案,先用特权 BEV 信息高效训练世界模型,再通过时空对齐机制指导原始传感器世界模型,成为首个在 CARLA v2 上成功的端到端原始传感器 MBRL 方法。
🤔 要解决什么问题?
端到端自动驾驶的训练范式对比:
| 范式 | 问题 | 原因 |
|---|---|---|
| 模仿学习(IL) | 因果混淆 + 分布偏移 | 学的是"专家在做什么"而非"应该做什么" |
| 无模型强化学习(MFRL) | 样本效率低,难以收敛 | 高维原始观测空间探索极困难 |
| 模型基RL(MBRL) | 仅适用于特权输入 | 原始传感器数据高维冗余,世界模型难以学习 |
核心问题:能否设计一个 MBRL 框架,使其既能享受 RL 的因果推理优势,又能在原始传感器输入上直接工作?
💡 核心思想
RAW2Drive 的双流方案:
- 特权流(Privileged Stream):用 BEV 语义掩码作为输入,高效训练一个特权世界模型和特权策略
- 原始传感器流(Raw Sensor Stream):用多视图 RGB 图像作为输入,在对齐机制的引导下学习原始传感器世界模型
关键洞察:低维特权信息的世界模型容易训练,且质量高,可以作为"教师"来引导原始传感器流的学习。
⚙️ 方法细节
整体架构
RAW2Drive 包含四个核心组件:
| 组件 | 特权流 | 原始传感器流 |
|---|---|---|
| 世界模型 | RSSM + Encoder/Decoder/Reward/Continue heads | RSSM + Encoder/Decoder (仅保留 Decoder) |
| 策略 | 基于世界模型 rollouts 训练 | 基于对齐后的世界模型训练 |
| 输入 | 时序 BEV 语义掩码 | 时序多视图 RGB 图像 |
引导机制(Guidance Mechanism)
引导机制包含三个层次:
1. 时空对齐损失(Spatial-Temporal Alignment Loss): 对齐特权流和原始传感器流的编码状态:
$$ \mathcal{L}_{align} = \|e_t - \hat{e}_t\|^2 $$其中 $e_t$ 是特权编码状态,$\hat{e}_t$ 是原始传感器编码状态。
2. Reward/Continue 头重用: 原始传感器流的 reward 和 continue 预测头直接使用特权世界模型的参数,避免从零学习困难的价值预测。
3. 动作蒸馏(Action Distillation): 使用特权策略的 rollout 数据填充回放缓冲区,并蒸馏动作分布到原始传感器策略。
为什么去掉原始传感器流的 Reward/Continue 头?
消融实验发现保留这两个头反而有害:
| 配置 | DS | SR |
|---|---|---|
| 无 Decoder/Reward/Continue 头 | 17.4 | 1.2/10 |
| 仅 Decoder | 83.5 | 7.5/10 |
| Decoder + Reward | 72.1 | 5.8/10 |
| Decoder + Continue | 68.3 | 4.9/10 |
| 三者全有 | 58.7 | 3.6/10 |
原因:原始视觉数据在相邻帧间高度相似,但 reward 和 continue 信号可能剧烈跳变,网络难以同时学习感知一致性和价值预测。
🧪 实验与结果
Bench2Drive 闭环评估
| 方法 | 类型 | DS ↑ | SR ↑ |
|---|---|---|---|
| UniAD | IL | 36.2 | 1.5/10 |
| VAD | IL | 40.8 | 2.3/10 |
| DriveTransformer | IL | 72.4 | 5.6/10 |
| Think2Drive (privileged) | MBRL | 51.7 | 3.1/10 |
| RAW2Drive | MBRL (raw) | 83.5 | 7.5/10 |
多能力评估
| 能力 | RAW2Drive | DriveTransformer | 提升 |
|---|---|---|---|
| 左转 | 72.3% | 58.1% | +14.2% |
| 右转 | 76.8% | 62.4% | +14.4% |
| 直行 | 91.2% | 85.6% | +5.6% |
| 车道保持 | 94.5% | 91.2% | +3.3% |
| 交通灯遵守 | 88.7% | 76.3% | +12.4% |
| 避障 | 71.4% | 45.8% | +25.6% |
消融实验
| 组件 | DS | 说明 |
|---|---|---|
| 完整 RAW2Drive | 83.5 | |
| w/o 对齐损失 | 61.2 | 时空状态对齐关键 |
| w/o Reward 头重用 | 74.8 | 价值引导有助 |
| w/o 动作蒸馏 | 68.5 | 特权策略知识重要 |
| w/o 特权流(从头训练) | 18.3 | 双流方案不可少 |
⚠️ 局限与未来方向
- 依赖 CARLA 仿真环境:特权信息(BEV 语义掩码)在真实世界中不可直接获得
- 两阶段训练复杂度高:需要先训练特权流,再训练原始传感器流
- 对齐损失对感知质量敏感:如果原始传感器编码质量差,对齐会失效
- 仅基于视觉输入:未探索 LiDAR 或其他模态
📝 个人思考
RAW2Drive 的双流特权引导方案在思路上与 VAE/蒸馏有亲缘关系——用干净的低维信号引导冗余的高维信号学习。区别在于这是在一个 MBRL 框架内完成的,世界模型不仅要学会"理解现在",还要学会"预测未来"。
最有工程价值的发现是 Reward/Continue 头反而有害。直觉上,给原始传感器世界模型更多的预测头应该帮助学习,但实验证明 decoder-only 的效果最好。这提示我们:原始传感器世界模型的瓶颈是感知质量,而非价值预测——先把"看清楚"的问题解决,再把"判断好坏"的任务交给特权世界模型。
与 NoRD 相比,RAW2Drive 也用了 RL,但目标不同:NoRD 用 RL 优化最终驾驶得分,RAW2Drive 用 RL 学习世界模型内的规划策略。两种 RL 的 VLA 结合方式值得区分。
📖 这是论文精读系列的第 XX 篇。特权知识蒸馏到原始传感器,是通往真实世界 MBRL 的一条务实路径。欢迎留言讨论。