<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>🎮 强化学习 on Elon&#39;s AD Insight</title>
    <link>https://auto-driving-blog.pages.dev/tags/-%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/</link>
    <description>Recent content in 🎮 强化学习 on Elon&#39;s AD Insight</description>
    <image>
      <title>Elon&#39;s AD Insight</title>
      <url>https://auto-driving-blog.pages.dev/images/share.png</url>
      <link>https://auto-driving-blog.pages.dev/images/share.png</link>
    </image>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Mon, 17 Aug 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://auto-driving-blog.pages.dev/tags/-%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>个人思考｜强化学习 &#43; 生成式轨迹规划：四种范式、核心挑战与未来方向</title>
      <link>https://auto-driving-blog.pages.dev/posts/thoughts/rl-diffusion-traj/</link>
      <pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/thoughts/rl-diffusion-traj/</guid>
      <description>RL + 生成式轨迹是 2025-2026 最火热的方向之一。本文从一个小白的视角，梳理 SFT 的天花板、四种 RL 范式（奖励引导、拒绝采样、策略梯度、世界模型），深入分析 log-prob 难题和 reward hacking，用大量对比图和流程图让每个概念一目了然。最后给出了自己的理解和未来方向判断。</description>
    </item>
    <item>
      <title>论文精读｜NoRD：无需推理的高效数据驱动 VLA</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/nord%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/nord%E7%B2%BE%E8%AF%BB/</guid>
      <description>NoRD 挑战 VLA 对大规模数据和推理标注的依赖，仅用 60% 数据 + 零推理标注即可达到可比性能。核心发现是标准 GRPO 在弱策略上由于难度偏差（Difficulty Bias）失效，引入 Dr.GRPO 后从 0.67% 提升扭转为 11.68% 的显著增益。</description>
    </item>
    <item>
      <title>论文精读｜AlpaMayo-R1：因果推理链 &#43; RL 驱动的 VLA 驾驶策略</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/alpamayo-r1%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/alpamayo-r1%E7%B2%BE%E8%AF%BB/</guid>
      <description>NVIDIA 提出 AlpaMayo-R1，一个融合 Chain of Causation 因果推理与 GRPO 强化学习的 VLA 模型。它基于 Cosmos-Reason VLM 骨干，通过结构化 CoC 数据集实现决策锚定的因果推理，利用 Flow Matching 动作解码器生成连续轨迹。三阶段训练（动作注入→推理微调→RL后训练）在长尾场景中取得显著提升：规划准确率 +12%，近距离冲突率 -35%，推理质量 +45%。真车路测延迟仅 99ms。</description>
    </item>
    <item>
      <title>论文精读｜RAW2Drive：对齐世界模型的强化学习端到端驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/raw2drive%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/raw2drive%E7%B2%BE%E8%AF%BB/</guid>
      <description>RAW2Drive 提出双流模型基强化学习框架，先用特权信息（BEV 语义）高效训练特权世界模型+策略，再通过对齐机制引导原始传感器世界模型的学习，实现首个从原始传感器直接规划端到端 MBRL 方法。在 Bench2Drive 上 DS 达 83.5，超越所有原始传感器基线。</description>
    </item>
    <item>
      <title>Flow-GRPO 详解：流匹配策略的强化学习优化</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/flow-grpo%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/flow-grpo%E8%AF%A6%E8%A7%A3/</guid>
      <description>Flow-GRPO 将 Group Relative Policy Optimization 引入流匹配策略训练，让扩散/流匹配模型不再只靠模仿学习，而是能通过奖励信号自主探索更优的驾驶策略。它采用 ODE-to-SDE 转换与 Denoising Reduction 技术，在 SD3、FLUX 等模型上验证了有效性。为生成式模型在自动驾驶规划中的强化学习优化提供了全新范式。</description>
    </item>
    <item>
      <title>论文精读｜SimWAM：把世界模型当&#39;训练老师&#39;，用 Flow-GRPO 让 Action Expert 学会&#39;自己开车&#39;</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/simwam%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Mon, 17 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/simwam%E7%B2%BE%E8%AF%BB/</guid>
      <description>SimWAM 用 joint flow matching 把预训练视频专家的交通动态先验&amp;rsquo;蒸馏&amp;rsquo;进轻量级 Action Expert，再用隔离注意力掩码让动作分支彻底摆脱未来帧依赖；随后把确定性 Flow ODE 转成可探索的 SDE，用 GRPO 直接优化 NAVSIM 组合驾驶奖励，突破模仿学习的上限。91.5 PDMS 新 SOTA，推理时延大幅低于 imagine-then-act 的 WAM，并零样本迁移到 nuScenes。</description>
    </item>
    <item>
      <title>AlpaSim 详解：面向强化学习的自动驾驶仿真评测框架</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/alpasim%E4%BB%BF%E7%9C%9F%E6%A1%86%E6%9E%B6%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/alpasim%E4%BB%BF%E7%9C%9F%E6%A1%86%E6%9E%B6%E8%AF%A6%E8%A7%A3/</guid>
      <description>AlpaSim 是一个面向强化学习训练与评测的自动驾驶仿真框架，支持闭环训练、多场景评测和安全验证。它采用微服务架构与神经渲染引擎 NRE，兼顾传感器保真度与横向可扩展性。是连接驾驶策略训练和部署验证的关键基础设施。</description>
    </item>
    <item>
      <title>论文精读｜ReCogDrive：小米EV强化认知端到端自动驾驶框架</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/recogdrive%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/recogdrive%E7%B2%BE%E8%AF%BB/</guid>
      <description>华科×小米EV 提出 ReCogDrive，将 VLM 认知推理（场景理解与决策分析）、扩散规划器（连续轨迹生成）和 DiffGRPO 强化学习（安全优化）三阶段统一。它的层级化数据流水线自动生成含推理链的 VQA 标注，解决了 VLM&amp;rsquo;会想但不会开&amp;rsquo;的模态错配问题。在 NAVSIM 和 Bench2Drive 上达到 SOTA，验证了&amp;rsquo;认知-规划-优化&amp;rsquo;三分天下的 VLA 设计范式。</description>
    </item>
    <item>
      <title>知识点拆解｜GRPO 强化学习方法详解：从 DeepSeek 到自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/grpo%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E6%96%B9%E6%B3%95%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/grpo%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E6%96%B9%E6%B3%95%E8%AF%A6%E8%A7%A3/</guid>
      <description>GRPO 用&amp;rsquo;组内相对优势&amp;rsquo;替代 PPO 的 critic 网络，大幅降低大模型强化学习的训练成本与显存开销。它通过对同一 prompt 采样一组回答并基于组内奖励均值做基线来实现策略优化。已在 DeepSeek-R1 及自动驾驶项目 AlphaDrive、Flow-GRPO 中成为首选 RL 算法。</description>
    </item>
    <item>
      <title>知识点拆解｜PPO 算法深度拆解：从 Policy Gradient 到 GRPO 的进化之路</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/ppo%E7%AE%97%E6%B3%95%E6%B7%B1%E5%BA%A6%E6%8B%86%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/ppo%E7%AE%97%E6%B3%95%E6%B7%B1%E5%BA%A6%E6%8B%86%E8%A7%A3/</guid>
      <description>PPO 通过 clipped surrogate objective 和 GAE 实现稳定策略更新，是 RLHF 时代的核心算法。本文从 REINFORCE 出发，拆解 PPO 的每个关键组件，并对比 GRPO 的革新——去掉 critic，用组内相对优势替代。最后梳理 PPO/GRPO 在 VLA 驾驶模型（AlphaDrive、ReCogDrive、DriveVLA-W0）中的应用。</description>
    </item>
    <item>
      <title>知识点拆解｜自动驾驶强化学习中的 Reward 函数设计详解</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E4%B8%ADreward%E8%AE%BE%E8%AE%A1%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6%E4%B8%ADreward%E8%AE%BE%E8%AE%A1%E8%AF%A6%E8%A7%A3/</guid>
      <description>Reward 函数决定了驾驶强化学习的性能天花板，必须在安全、舒适、合规、效率之间艰难权衡。本文系统拆解 reward 设计的四大组件（安全、舒适、合规、效率）、三大范式与常见陷阱。同时梳理了 NAVSIM、nuPlan 等评测指标如何反哺 reward 设计，为驾驶 RL 提供实操指南。</description>
    </item>
    <item>
      <title>知识点拆解｜离线强化学习详解：从 CQL、IQL 到自动驾驶 VLA</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E7%A6%BB%E7%BA%BF%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E7%A6%BB%E7%BA%BF%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E8%AF%A6%E8%A7%A3/</guid>
      <description>离线 RL 让智能体从静态数据集中学习，无需在线交互，对自动驾驶等安全关键领域至关重要。本文详解 CQL、IQL、TD3+BC 等核心算法，讨论分布偏移与 OOD 动作问题，并梳理离线预训练→在线微调范式在 VLA 驾驶模型中的应用与趋势。</description>
    </item>
    <item>
      <title>知识点拆解｜RLHF 与偏好对齐详解：从大模型到自动驾驶驾驶风格学习</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/rlhf%E4%B8%8E%E5%81%8F%E5%A5%BD%E5%AF%B9%E9%BD%90%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/rlhf%E4%B8%8E%E5%81%8F%E5%A5%BD%E5%AF%B9%E9%BD%90%E8%AF%A6%E8%A7%A3/</guid>
      <description>RLHF 通过人类偏好反馈将模型行为对齐到人类期望。本文详解 RLHF 三阶段流程、Bradley-Terry 奖励模型、DPO 直接偏好优化，并分析 GRPO 如何避免显式 reward 建模。在驾驶场景中，偏好对齐天然适配&amp;rsquo;不同人有不同驾驶风格&amp;rsquo;这一人类直觉——有人偏好激进、有人偏好保守，RLHF 让 VLA 模型学会按需生成驾驶行为。</description>
    </item>
    <item>
      <title>知识点拆解｜强化学习基础：从MDP到PPO</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9F%BA%E7%A1%80%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9F%BA%E7%A1%80%E8%AF%A6%E8%A7%A3/</guid>
      <description>强化学习通过试错交互自主优化策略，是继监督学习之后最具潜力的自动驾驶训练范式。本文从 MDP 五元组出发，系统讲解策略梯度、PPO/SAC/DDPG 等主流 RL 算法的数学原理与演进脉络。并深入分析各算法在自动驾驶决策与规划中的适用场景与落地挑战。</description>
    </item>
    <item>
      <title>知识点拆解｜逆强化学习详解：从专家演示中学会&#39;为什么这么开&#39;</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/%E9%80%86%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/%E9%80%86%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E8%AF%A6%E8%A7%A3/</guid>
      <description>逆强化学习（IRL）解决的是&amp;rsquo;从行为反推动机&amp;rsquo;的问题——给定专家演示，推断 driving force 背后的 reward 函数。本文详解最大熵 IRL、GAIL/AIRL 对抗方法，阐明 IRL 与 BC、RL 的本质区别，并梳理 IRL 在自动驾驶中的应用：从人类驾驶数据中学习 reward，再用 RL 优化策略。最后讨论偏好 IRL 和 VLM 作为 reward 的最新趋势。</description>
    </item>
    <item>
      <title>论文精读｜AlphaDrive：GRPO 强化学习唤醒驾驶推理与多模态规划</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/alphadrive-grpo%E9%A9%BE%E9%A9%B6%E7%AD%96%E7%95%A5%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/alphadrive-grpo%E9%A9%BE%E9%A9%B6%E7%AD%96%E7%95%A5%E7%B2%BE%E8%AF%BB/</guid>
      <description>AlphaDrive 把 DeepSeek R1 式的 GRPO 推理强化学习首次引入自动驾驶规划，将高层驾驶决策建模为元动作分类问题。它设计了四个面向规划的专门奖励，配合 SFT 预热+RL 探索两阶段策略。仅 2B 参数的 Qwen2VL 模型反超 7B 系列，并涌现出&amp;rsquo;一景多解&amp;rsquo;的多模态规划能力。</description>
    </item>
    <item>
      <title>论文精读｜DreamerV3：通过世界模型掌握多样领域——通用强化学习智能体</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/dreamerv3%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/dreamerv3%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E7%B2%BE%E8%AF%BB/</guid>
      <description>DreamerV3 是 DeepMind 提出的通用强化学习算法，通过学习世界模型并在想象中规划，以单一固定超参数配置在 150 多个多样化任务上超越专用算法。首次从零开始在 Minecraft 中收集钻石，标志着强化学习向通用化迈出了重要一步。</description>
    </item>
    <item>
      <title>论文精读｜Gen-Drive：扩散模型生成 &#43; 强化学习精调的驾驶策略</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/gen-drive%E6%89%A9%E6%95%A3%E5%BC%BA%E5%8C%96%E9%A9%BE%E9%A9%B6%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/gen-drive%E6%89%A9%E6%95%A3%E5%BC%BA%E5%8C%96%E9%A9%BE%E9%A9%B6%E7%B2%BE%E8%AF%BB/</guid>
      <description>Gen-Drive 把自动驾驶规划从&amp;rsquo;预测-规划&amp;rsquo;重构为&amp;rsquo;生成-评估&amp;rsquo;范式：行为扩散模型生成多样未来场景，学习型场景评估器（VLM 辅助训练）打分，再用 RL 微调扩散策略向高分方向优化。它创造性地将 RLHF 奖励建模思路搬进驾驶领域，验证了学习型 reward 优于人工设计。在闭环评测中展现了生成式+强化学习融合的潜力。</description>
    </item>
  </channel>
</rss>
