论文精读:DiffusionDriveV2 — RL-Constrained Truncated Diffusion

DiffusionDriveV2 将强化学习引入截断扩散模型,提出 Intra-Anchor GRPO 和 Inter-Anchor Truncated GRPO,解决了 DiffusionDrive 中多样性与一致高质量之间的根本矛盾。在 NAVSIM v1 上达到 91.2 PDMS,v2 上达到 85.5 EPDMS,均创下新纪录。

2026年7月19日 · 5 分钟 · 920 字 ·