<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>📐 策略优化 on Elon&#39;s AD Insight</title>
    <link>https://auto-driving-blog.pages.dev/tags/-%E7%AD%96%E7%95%A5%E4%BC%98%E5%8C%96/</link>
    <description>Recent content in 📐 策略优化 on Elon&#39;s AD Insight</description>
    <image>
      <title>Elon&#39;s AD Insight</title>
      <url>https://auto-driving-blog.pages.dev/images/share.png</url>
      <link>https://auto-driving-blog.pages.dev/images/share.png</link>
    </image>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Wed, 22 Jul 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://auto-driving-blog.pages.dev/tags/-%E7%AD%96%E7%95%A5%E4%BC%98%E5%8C%96/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>论文精读｜AlpaMayo-R1：因果推理链 &#43; RL 驱动的 VLA 驾驶策略</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/alpamayo-r1%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/alpamayo-r1%E7%B2%BE%E8%AF%BB/</guid>
      <description>NVIDIA 提出 AlpaMayo-R1，一个融合 Chain of Causation 因果推理与 GRPO 强化学习的 VLA 模型。它基于 Cosmos-Reason VLM 骨干，通过结构化 CoC 数据集实现决策锚定的因果推理，利用 Flow Matching 动作解码器生成连续轨迹。三阶段训练（动作注入→推理微调→RL后训练）在长尾场景中取得显著提升：规划准确率 +12%，近距离冲突率 -35%，推理质量 +45%。真车路测延迟仅 99ms。</description>
    </item>
    <item>
      <title>知识点拆解｜GRPO 强化学习方法详解：从 DeepSeek 到自动驾驶</title>
      <link>https://auto-driving-blog.pages.dev/posts/knowledge/grpo%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E6%96%B9%E6%B3%95%E8%AF%A6%E8%A7%A3/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/knowledge/grpo%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E6%96%B9%E6%B3%95%E8%AF%A6%E8%A7%A3/</guid>
      <description>GRPO 用&amp;rsquo;组内相对优势&amp;rsquo;替代 PPO 的 critic 网络，大幅降低大模型强化学习的训练成本与显存开销。它通过对同一 prompt 采样一组回答并基于组内奖励均值做基线来实现策略优化。已在 DeepSeek-R1 及自动驾驶项目 AlphaDrive、Flow-GRPO 中成为首选 RL 算法。</description>
    </item>
    <item>
      <title>论文精读｜AlphaDrive：GRPO 强化学习唤醒驾驶推理与多模态规划</title>
      <link>https://auto-driving-blog.pages.dev/posts/paper-reading/alphadrive-grpo%E9%A9%BE%E9%A9%B6%E7%AD%96%E7%95%A5%E7%B2%BE%E8%AF%BB/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://auto-driving-blog.pages.dev/posts/paper-reading/alphadrive-grpo%E9%A9%BE%E9%A9%B6%E7%AD%96%E7%95%A5%E7%B2%BE%E8%AF%BB/</guid>
      <description>AlphaDrive 把 DeepSeek R1 式的 GRPO 推理强化学习首次引入自动驾驶规划，将高层驾驶决策建模为元动作分类问题。它设计了四个面向规划的专门奖励，配合 SFT 预热+RL 探索两阶段策略。仅 2B 参数的 Qwen2VL 模型反超 7B 系列，并涌现出&amp;rsquo;一景多解&amp;rsquo;的多模态规划能力。</description>
    </item>
  </channel>
</rss>
