<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>GRPO on Elon&#39;s AD Insight</title>
    <link>https://auto-driving-blog.pages.dev/tags/grpo/</link>
    <description>Recent content in GRPO on Elon&#39;s AD Insight</description>
    <image>
      <title>Elon&#39;s AD Insight</title>
      <url>https://auto-driving-blog.pages.dev/images/share.png</url>
      <link>https://auto-driving-blog.pages.dev/images/share.png</link>
    </image>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Sun, 06 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://auto-driving-blog.pages.dev/tags/grpo/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>论文精读｜ExploreVLA：密集世界建模与探索驱动的端到端自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-02714/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-02714/</guid>
      <description>VLA 模型通过行为克隆学习驾驶策略，但受限于模仿学习无法探索专家分布之外的高质量策略。ExploreVLA 提出统一的理解-生成框架：用未来 RGB + 深度图生成作为密集世界建模目标，再利用世界模型的图像预测不确定性作为内在探索奖励，通过安全门控的 GRPO 优化策略。在 NAVSIM 上达到 93.7 PDMS 和 88.8 EPDMS。</description>
    </item>
    <item>
      <title>SimWAM 代码完整解读：从 Video DiT 到 Action DiT，从 SFT 到 FlowGRPO 的逐行拆解</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/simwam%E4%BB%A3%E7%A0%81%E5%AE%8C%E6%95%B4%E8%A7%A3%E8%AF%BB/</link>
      <pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/simwam%E4%BB%A3%E7%A0%81%E5%AE%8C%E6%95%B4%E8%A7%A3%E8%AF%BB/</guid>
      <description>从 configs/model/simwam_navsim.yaml 第 1 行开始，逐层追踪 SimWAM 的完整逻辑链：两个专家怎么协作？Isolated Attention Mask 怎么实现训练时借力、推理时独立？联合 Flow Matching 训练的损失怎么算？FlowGRPO 的 SDE 采样、PDM 奖励、LoRA 微调怎么串起来？每段代码都标注了源文件路径。</description>
    </item>
    <item>
      <title>Flow-GRPO 完全讲解：训练/推理/梯度流/Loss 设计的逐行拆解</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/flow-grpo-complete-guide/</link>
      <pubDate>Thu, 30 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/flow-grpo-complete-guide/</guid>
      <description>从 train_flux_fast.py 第 1 行开始，逐层追踪 Flow-GRPO 的完整逻辑链：采样阶段做了什么？reward 怎么变成 advantage？训练阶段的计算图是怎么构造的？loss 为什么那样设计？梯度如何从最后一个 log_prob 传到 LoRA 参数？每段代码都标注了源文件行号。</description>
    </item>
    <item>
      <title>端到端自动驾驶模型架构全解：从感知到规划的六大范式与 80&#43; 模型逐篇拆解</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/autonomous-driving-model-architecture-synthesis/</link>
      <pubDate>Mon, 10 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/autonomous-driving-model-architecture-synthesis/</guid>
      <description>把博客全部自动驾驶模型精读收进同一坐标系：显式端到端 / Scoring / 扩散与Flow / VLA / 世界模型 / 数据评测基建六大范式，80&#43; 模型逐篇给出感知表征、架构组成、训练方式与 PDMS/EPDMS 分数，最后给出我对端到端演进方向的个人思考。</description>
    </item>
    <item>
      <title>AlpaMayo-R1 代码讲解：VLM 说推理链、Expert 雕轨迹、一个模型两套头</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/alpamayo-r1%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/alpamayo-r1%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>零基础逐文件拆解 NVIDIA AlpaMayo-R1 推理源码：从 VLM/Expert/Diffusion 三组件架构到单轮动力学动作空间，从 Flow Matching 去噪到 Fourier 特征编码，用伪代码 + 大白话讲清这个 10B 参数的 VLA 模型是怎么从传感器数据一路「推理」到轨迹输出的。</description>
    </item>
    <item>
      <title>AutoVLA 代码讲解：把「开车」变成「说动作 token」并用 GRPO 微调</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/autovla%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/autovla%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>拆解 ucla-mobility/AutoVLA：动作 codebook 离散化、快慢思考两阶段训练、SFT &#43; GRPO 拒绝采样微调，看 VLA 如何端到端输出可执行驾驶动作</description>
    </item>
    <item>
      <title>代码讲解：DiffusionDriveV2 — 用 GRPO 强化学习给截断扩散的多样轨迹「上安全锁」</title>
      <link>https://auto-driving-blog.pages.dev/posts/code/diffusiondrivev2%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/code/diffusiondrivev2%E4%BB%A3%E7%A0%81%E8%AE%B2%E8%A7%A3/</guid>
      <description>「DiffusionDriveV2 在 DiffusionDrive 的 anchor 截断扩散之上，补了一套 GRPO 强化学习微调：用 scale-adaptive 乘性噪声做探索、Intra-Anchor GRPO 保住多模态不坍缩、Inter-Anchor Truncated GRPO 用碰撞惩罚把低质量轨迹压下去，最后加两级 Mode Selector 精排，在 NAVSIM v1 上冲到 91.2 PDMS。本文基于论文 Algorithm 还原成逐文件逐函数伪代码，从 cold start 权重加载写到 rollout → advantage → loss 的完整 RL 训练循环。」</description>
    </item>
    <item>
      <title>论文精读：FeaXDrive — Feasibility-aware Trajectory-Centric Diffusion Planning</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-12656/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2604-12656/</guid>
      <description>FeaXDrive 发现噪声中心扩散规划与轨迹可行性空间存在根本错位，提出轨迹中心扩散框架，通过自适应曲率正则化训练、可行驶区域引导推理和可行性感知 GRPO 后训练系统提升轨迹物理可行性。在 NAVSIM 上达 88.7 PDMS (IL) / 90.0 PDMS (RL)，曲率违反率从 8.59% 降至 0.88%。</description>
    </item>
    <item>
      <title>论文精读｜AutoDrive-P³：感知-预测-规划链式思维的统一强化微调——ICLR 2026 端到端驾驶新范式</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-28116/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BB-2603-28116/</guid>
      <description>当前 VLM 驾驶方案要么直接输出规划缺失 CoT 推理，要么将感知-预测-规划割裂为独立模块缺乏协同。AutoDrive-P³ 提出统一链式思维框架，通过 P³-CoT 数据集构建感知→预测→规划的结构化推理链，再用 P³-GRPO 算法进行分层渐进式强化微调——将奖励从规划反传到感知和预测模块，实现三模块联合优化。在 NAVSIM 上达到 89.9 EPDMS，nuScenes 上取得最低碰撞率。</description>
    </item>
  </channel>
</rss>
