论文精读|ExploreVLA:密集世界建模与探索驱动的端到端自动驾驶

VLA 模型通过行为克隆学习驾驶策略,但受限于模仿学习无法探索专家分布之外的高质量策略。ExploreVLA 提出统一的理解-生成框架:用未来 RGB + 深度图生成作为密集世界建模目标,再利用世界模型的图像预测不确定性作为内在探索奖励,通过安全门控的 GRPO 优化策略。在 NAVSIM 上达到 93.7 PDMS 和 88.8 EPDMS。

2026年7月19日 · 5 分钟 · 946 字 · 

Flow-GRPO 完全讲解:训练/推理/梯度流/Loss 设计的逐行拆解

从 train_flux_fast.py 第 1 行开始,逐层追踪 Flow-GRPO 的完整逻辑链:采样阶段做了什么?reward 怎么变成 advantage?训练阶段的计算图是怎么构造的?loss 为什么那样设计?梯度如何从最后一个 log_prob 传到 LoRA 参数?每段代码都标注了源文件行号。

2026年7月30日 · 24 分钟 · 5063 字 · 

Flow-GRPO 源码学习与策略复现

基于 Flow-GRPO 的自动驾驶策略源码学习与复现记录,含小白友好的阅读顺序与教学注释。

2026年7月20日 · 1 分钟 · 26 字 · 

代码讲解:DiffusionDriveV2 — 用 GRPO 强化学习给截断扩散的多样轨迹「上安全锁」

「DiffusionDriveV2 在 DiffusionDrive 的 anchor 截断扩散之上,补了一套 GRPO 强化学习微调:用 scale-adaptive 乘性噪声做探索、Intra-Anchor GRPO 保住多模态不坍缩、Inter-Anchor Truncated GRPO 用碰撞惩罚把低质量轨迹压下去,最后加两级 Mode Selector 精排,在 NAVSIM v1 上冲到 91.2 PDMS。本文基于论文 Algorithm 还原成逐文件逐函数伪代码,从 cold start 权重加载写到 rollout → advantage → loss 的完整 RL 训练循环。」

2026年7月20日 · 15 分钟 · 3012 字 · 

论文精读|AutoDrive-P³:感知-预测-规划链式思维的统一强化微调——ICLR 2026 端到端驾驶新范式

当前 VLM 驾驶方案要么直接输出规划缺失 CoT 推理,要么将感知-预测-规划割裂为独立模块缺乏协同。AutoDrive-P³ 提出统一链式思维框架,通过 P³-CoT 数据集构建感知→预测→规划的结构化推理链,再用 P³-GRPO 算法进行分层渐进式强化微调——将奖励从规划反传到感知和预测模块,实现三模块联合优化。在 NAVSIM 上达到 89.9 EPDMS,nuScenes 上取得最低碰撞率。

2026年7月19日 · 5 分钟 · 951 字 ·