个人思考|强化学习 + 生成式轨迹规划:四种范式、核心挑战与未来方向

RL + 生成式轨迹是 2025-2026 最火热的方向之一。本文从一个小白的视角,梳理 SFT 的天花板、四种 RL 范式(奖励引导、拒绝采样、策略梯度、世界模型),深入分析 log-prob 难题和 reward hacking,用大量对比图和流程图让每个概念一目了然。最后给出了自己的理解和未来方向判断。

2026年7月22日 · 16 分钟 · 3355 字 · 

论文精读|NoRD:无需推理的高效数据驱动 VLA

NoRD 挑战 VLA 对大规模数据和推理标注的依赖,仅用 60% 数据 + 零推理标注即可达到可比性能。核心发现是标准 GRPO 在弱策略上由于难度偏差(Difficulty Bias)失效,引入 Dr.GRPO 后从 0.67% 提升扭转为 11.68% 的显著增益。

2026年7月24日 · 2 分钟 · 360 字 · 

论文精读|AlpaMayo-R1:因果推理链 + RL 驱动的 VLA 驾驶策略

NVIDIA 提出 AlpaMayo-R1,一个融合 Chain of Causation 因果推理与 GRPO 强化学习的 VLA 模型。它基于 Cosmos-Reason VLM 骨干,通过结构化 CoC 数据集实现决策锚定的因果推理,利用 Flow Matching 动作解码器生成连续轨迹。三阶段训练(动作注入→推理微调→RL后训练)在长尾场景中取得显著提升:规划准确率 +12%,近距离冲突率 -35%,推理质量 +45%。真车路测延迟仅 99ms。

2026年7月22日 · 5 分钟 · 873 字 · 

论文精读|RAW2Drive:对齐世界模型的强化学习端到端驾驶

RAW2Drive 提出双流模型基强化学习框架,先用特权信息(BEV 语义)高效训练特权世界模型+策略,再通过对齐机制引导原始传感器世界模型的学习,实现首个从原始传感器直接规划端到端 MBRL 方法。在 Bench2Drive 上 DS 达 83.5,超越所有原始传感器基线。

2026年7月24日 · 2 分钟 · 300 字 · 

Flow-GRPO 详解:流匹配策略的强化学习优化

Flow-GRPO 将 Group Relative Policy Optimization 引入流匹配策略训练,让扩散/流匹配模型不再只靠模仿学习,而是能通过奖励信号自主探索更优的驾驶策略。它采用 ODE-to-SDE 转换与 Denoising Reduction 技术,在 SD3、FLUX 等模型上验证了有效性。为生成式模型在自动驾驶规划中的强化学习优化提供了全新范式。

2026年7月19日 · 6 分钟 · 1154 字 · 

论文精读|SimWAM:把世界模型当'训练老师',用 Flow-GRPO 让 Action Expert 学会'自己开车'

SimWAM 用 joint flow matching 把预训练视频专家的交通动态先验’蒸馏’进轻量级 Action Expert,再用隔离注意力掩码让动作分支彻底摆脱未来帧依赖;随后把确定性 Flow ODE 转成可探索的 SDE,用 GRPO 直接优化 NAVSIM 组合驾驶奖励,突破模仿学习的上限。91.5 PDMS 新 SOTA,推理时延大幅低于 imagine-then-act 的 WAM,并零样本迁移到 nuScenes。

2026年8月17日 · 12 分钟 · 2408 字 · 

AlpaSim 详解:面向强化学习的自动驾驶仿真评测框架

AlpaSim 是一个面向强化学习训练与评测的自动驾驶仿真框架,支持闭环训练、多场景评测和安全验证。它采用微服务架构与神经渲染引擎 NRE,兼顾传感器保真度与横向可扩展性。是连接驾驶策略训练和部署验证的关键基础设施。

2026年7月19日 · 4 分钟 · 651 字 · 

论文精读|ReCogDrive:小米EV强化认知端到端自动驾驶框架

华科×小米EV 提出 ReCogDrive,将 VLM 认知推理(场景理解与决策分析)、扩散规划器(连续轨迹生成)和 DiffGRPO 强化学习(安全优化)三阶段统一。它的层级化数据流水线自动生成含推理链的 VQA 标注,解决了 VLM’会想但不会开’的模态错配问题。在 NAVSIM 和 Bench2Drive 上达到 SOTA,验证了’认知-规划-优化’三分天下的 VLA 设计范式。

2026年7月19日 · 3 分钟 · 629 字 · 

知识点拆解|GRPO 强化学习方法详解:从 DeepSeek 到自动驾驶

GRPO 用’组内相对优势’替代 PPO 的 critic 网络,大幅降低大模型强化学习的训练成本与显存开销。它通过对同一 prompt 采样一组回答并基于组内奖励均值做基线来实现策略优化。已在 DeepSeek-R1 及自动驾驶项目 AlphaDrive、Flow-GRPO 中成为首选 RL 算法。

2026年7月19日 · 3 分钟 · 570 字 · 

知识点拆解|PPO 算法深度拆解:从 Policy Gradient 到 GRPO 的进化之路

PPO 通过 clipped surrogate objective 和 GAE 实现稳定策略更新,是 RLHF 时代的核心算法。本文从 REINFORCE 出发,拆解 PPO 的每个关键组件,并对比 GRPO 的革新——去掉 critic,用组内相对优势替代。最后梳理 PPO/GRPO 在 VLA 驾驶模型(AlphaDrive、ReCogDrive、DriveVLA-W0)中的应用。

2026年7月19日 · 4 分钟 · 730 字 · 

知识点拆解|自动驾驶强化学习中的 Reward 函数设计详解

Reward 函数决定了驾驶强化学习的性能天花板,必须在安全、舒适、合规、效率之间艰难权衡。本文系统拆解 reward 设计的四大组件(安全、舒适、合规、效率)、三大范式与常见陷阱。同时梳理了 NAVSIM、nuPlan 等评测指标如何反哺 reward 设计,为驾驶 RL 提供实操指南。

2026年7月19日 · 3 分钟 · 534 字 · 

知识点拆解|离线强化学习详解:从 CQL、IQL 到自动驾驶 VLA

离线 RL 让智能体从静态数据集中学习,无需在线交互,对自动驾驶等安全关键领域至关重要。本文详解 CQL、IQL、TD3+BC 等核心算法,讨论分布偏移与 OOD 动作问题,并梳理离线预训练→在线微调范式在 VLA 驾驶模型中的应用与趋势。

2026年7月19日 · 4 分钟 · 715 字 · 

知识点拆解|RLHF 与偏好对齐详解:从大模型到自动驾驶驾驶风格学习

RLHF 通过人类偏好反馈将模型行为对齐到人类期望。本文详解 RLHF 三阶段流程、Bradley-Terry 奖励模型、DPO 直接偏好优化,并分析 GRPO 如何避免显式 reward 建模。在驾驶场景中,偏好对齐天然适配’不同人有不同驾驶风格’这一人类直觉——有人偏好激进、有人偏好保守,RLHF 让 VLA 模型学会按需生成驾驶行为。

2026年7月19日 · 3 分钟 · 632 字 · 

知识点拆解|强化学习基础:从MDP到PPO

强化学习通过试错交互自主优化策略,是继监督学习之后最具潜力的自动驾驶训练范式。本文从 MDP 五元组出发,系统讲解策略梯度、PPO/SAC/DDPG 等主流 RL 算法的数学原理与演进脉络。并深入分析各算法在自动驾驶决策与规划中的适用场景与落地挑战。

2026年7月19日 · 3 分钟 · 491 字 · 

知识点拆解|逆强化学习详解:从专家演示中学会'为什么这么开'

逆强化学习(IRL)解决的是’从行为反推动机’的问题——给定专家演示,推断 driving force 背后的 reward 函数。本文详解最大熵 IRL、GAIL/AIRL 对抗方法,阐明 IRL 与 BC、RL 的本质区别,并梳理 IRL 在自动驾驶中的应用:从人类驾驶数据中学习 reward,再用 RL 优化策略。最后讨论偏好 IRL 和 VLM 作为 reward 的最新趋势。

2026年7月19日 · 5 分钟 · 919 字 · 

论文精读|AlphaDrive:GRPO 强化学习唤醒驾驶推理与多模态规划

AlphaDrive 把 DeepSeek R1 式的 GRPO 推理强化学习首次引入自动驾驶规划,将高层驾驶决策建模为元动作分类问题。它设计了四个面向规划的专门奖励,配合 SFT 预热+RL 探索两阶段策略。仅 2B 参数的 Qwen2VL 模型反超 7B 系列,并涌现出’一景多解’的多模态规划能力。

2026年7月19日 · 5 分钟 · 889 字 · 

论文精读|DreamerV3:通过世界模型掌握多样领域——通用强化学习智能体

DreamerV3 是 DeepMind 提出的通用强化学习算法,通过学习世界模型并在想象中规划,以单一固定超参数配置在 150 多个多样化任务上超越专用算法。首次从零开始在 Minecraft 中收集钻石,标志着强化学习向通用化迈出了重要一步。

2026年7月28日 · 3 分钟 · 452 字 · 

论文精读|Gen-Drive:扩散模型生成 + 强化学习精调的驾驶策略

Gen-Drive 把自动驾驶规划从’预测-规划’重构为’生成-评估’范式:行为扩散模型生成多样未来场景,学习型场景评估器(VLM 辅助训练)打分,再用 RL 微调扩散策略向高分方向优化。它创造性地将 RLHF 奖励建模思路搬进驾驶领域,验证了学习型 reward 优于人工设计。在闭环评测中展现了生成式+强化学习融合的潜力。

2026年7月19日 · 3 分钟 · 450 字 ·