论文精读|AlpaMayo-R1:因果推理链 + RL 驱动的 VLA 驾驶策略

NVIDIA 提出 AlpaMayo-R1,一个融合 Chain of Causation 因果推理与 GRPO 强化学习的 VLA 模型。它基于 Cosmos-Reason VLM 骨干,通过结构化 CoC 数据集实现决策锚定的因果推理,利用 Flow Matching 动作解码器生成连续轨迹。三阶段训练(动作注入→推理微调→RL后训练)在长尾场景中取得显著提升:规划准确率 +12%,近距离冲突率 -35%,推理质量 +45%。真车路测延迟仅 99ms。

2026年7月22日 · 5 分钟 · 873 字 · 

知识点拆解|GRPO 强化学习方法详解:从 DeepSeek 到自动驾驶

GRPO 用’组内相对优势’替代 PPO 的 critic 网络,大幅降低大模型强化学习的训练成本与显存开销。它通过对同一 prompt 采样一组回答并基于组内奖励均值做基线来实现策略优化。已在 DeepSeek-R1 及自动驾驶项目 AlphaDrive、Flow-GRPO 中成为首选 RL 算法。

2026年7月19日 · 3 分钟 · 570 字 · 

论文精读|AlphaDrive:GRPO 强化学习唤醒驾驶推理与多模态规划

AlphaDrive 把 DeepSeek R1 式的 GRPO 推理强化学习首次引入自动驾驶规划,将高层驾驶决策建模为元动作分类问题。它设计了四个面向规划的专门奖励,配合 SFT 预热+RL 探索两阶段策略。仅 2B 参数的 Qwen2VL 模型反超 7B 系列,并涌现出’一景多解’的多模态规划能力。

2026年7月19日 · 5 分钟 · 889 字 ·