代码讲解:DiffusionDrive 从架构到训练推理的完整闭环

逐行拆解 hustvl/DiffusionDrive 的真实源码,面向零基础读者:从架构图与全局数据流出发,用大白话讲清什么是 anchor、什么是去噪、什么是 cross-attention、什么是 BEV、什么是截断扩散,再逐文件讲清它如何作为 navsim 的 Agent 插件挂载,最后把一次前向传播拆成 7 到 8 步、把训练和推理的差异讲透。一篇把项目挂载方式→数据流→前向传播→训练梯度→推理选轨迹→个人思考全部讲明白的极详细工程向代码讲解。

2026年7月20日 · 9 分钟 · 1856 字 · 

代码讲解:DiffusionDriveV2 — 用 GRPO 强化学习给截断扩散的多样轨迹「上安全锁」

「DiffusionDriveV2 在 DiffusionDrive 的 anchor 截断扩散之上,补了一套 GRPO 强化学习微调:用 scale-adaptive 乘性噪声做探索、Intra-Anchor GRPO 保住多模态不坍缩、Inter-Anchor Truncated GRPO 用碰撞惩罚把低质量轨迹压下去,最后加两级 Mode Selector 精排,在 NAVSIM v1 上冲到 91.2 PDMS。本文基于论文 Algorithm 还原成逐文件逐函数伪代码,从 cold start 权重加载写到 rollout → advantage → loss 的完整 RL 训练循环。」

2026年7月20日 · 15 分钟 · 3012 字 ·