Flow Matching 入门详解:从扩散模型到连续动作生成(含代码讲解)

Flow Matching 通过直接学习从噪声到数据的直线 ODE 路径,解决了扩散模型弯曲路径导致采样步数过多的问题。本文从数学直觉出发讲解向量场、ODE 与流的核心概念,并对比 CFM、Rectified Flow、OT路径等关键变体。与普通教程不同的是,本文所有代码均来自 ByteDance Bagel / Flow-GRPO 的真实项目实现,包含 CFG 推理、SDE 采样、GRPO 策略优化等工业级代码讲解。

2026年7月18日 · 11 分钟 · 2135 字 · 

Flow-GRPO 详解:流匹配策略的强化学习优化

Flow-GRPO 将 Group Relative Policy Optimization 引入流匹配策略训练,让扩散/流匹配模型不再只靠模仿学习,而是能通过奖励信号自主探索更优的驾驶策略。它采用 ODE-to-SDE 转换与 Denoising Reduction 技术,在 SD3、FLUX 等模型上验证了有效性。为生成式模型在自动驾驶规划中的强化学习优化提供了全新范式。

2026年7月19日 · 6 分钟 · 1154 字 · 

论文精读|DiffusionDrive:扩散模型驱动的端到端轨迹规划

DiffusionDrive 将扩散模型引入自动驾驶轨迹规划,从噪声出发逐步去噪生成多条合理轨迹,解决了确定性回归的 mode averaging 痛点。它通过轨迹初始化先验和截断扩散策略大幅减少采样步数,让扩散规划真正跑在车端。在闭环评测中达到生成式端到端驾驶的领先水平。

2026年7月19日 · 3 分钟 · 573 字 · 

论文精读|ReCogDrive:小米EV强化认知端到端自动驾驶框架

华科×小米EV 提出 ReCogDrive,将 VLM 认知推理(场景理解与决策分析)、扩散规划器(连续轨迹生成)和 DiffGRPO 强化学习(安全优化)三阶段统一。它的层级化数据流水线自动生成含推理链的 VQA 标注,解决了 VLM’会想但不会开’的模态错配问题。在 NAVSIM 和 Bench2Drive 上达到 SOTA,验证了’认知-规划-优化’三分天下的 VLA 设计范式。

2026年7月19日 · 3 分钟 · 629 字 · 

知识点拆解|扩散模型基础:从DDPM到条件生成

扩散模型通过逐步加噪与逆向去噪实现从纯噪声到高质量数据的生成,已成为 GAN 之后最强大的生成范式。本文从 DDPM 的数学推导出发,详细讲解正向加噪过程、反向去噪网络以及条件生成方法。同时梳理了扩散模型在自动驾驶场景生成、轨迹规划中的数据增强应用全景。

2026年7月19日 · 2 分钟 · 426 字 · 

论文精读|Diffusion Planner:把轨迹规划重定义为扩散式未来生成

Diffusion Planner 把自动驾驶规划重定义为未来轨迹生成任务,用 Diffusion Transformer(DiT)将自车规划与他车预测联合建模为一次条件去噪过程。它通过免训练的分类器引导机制在推理时灵活注入安全、舒适与速度偏好。在 nuPlan 闭环评测中刷新 SOTA,开创了扩散式联合预测-规划的新范式。

2026年7月19日 · 3 分钟 · 581 字 · 

知识点拆解|条件扩散模型详解:引导方法与条件注入技术

条件生成是扩散模型落地的关键能力,涉及如何将文本、图像、深度图、驾驶命令等条件信息注入生成过程。本文深入讲解 Classifier-Free Guidance 与 Classifier Guidance 的数学原理、条件注入的四种技术方案、驾驶场景中的多模态条件设计,以及截断扩散和 Flow Matching 等加速方案。

2026年7月19日 · 4 分钟 · 749 字 · 

知识点拆解|Flow Matching 与扩散模型统一视角:从 SDE 到 ODE 的生成范式

扩散模型与 Flow Matching 是当前生成式 AI 的两大核心范式。本文从 SDE 与 ODE 的统一视角出发,深入讲解扩散模型的随机微分方程解释、Flow Matching 的向量场学习方法、Rectified Flow 的路径整流机制,揭示扩散是 Flow Matching 的特殊情况。同时总结两者在自动驾驶场景生成与轨迹规划中的应用对比。

2026年7月19日 · 5 分钟 · 940 字 · 

论文精读|Gen-Drive:扩散模型生成 + 强化学习精调的驾驶策略

Gen-Drive 把自动驾驶规划从’预测-规划’重构为’生成-评估’范式:行为扩散模型生成多样未来场景,学习型场景评估器(VLM 辅助训练)打分,再用 RL 微调扩散策略向高分方向优化。它创造性地将 RLHF 奖励建模思路搬进驾驶领域,验证了学习型 reward 优于人工设计。在闭环评测中展现了生成式+强化学习融合的潜力。

2026年7月19日 · 3 分钟 · 450 字 · 

论文精读|A Survey of World Models for Autonomous Driving:自动驾驶世界模型全景综述

这篇持续更新的综述为自动驾驶世界模型构建了一套三层分类法:Tier I 生成未来物理世界(Image/BEV/OG/PC 四类生成范式)、Tier II 智能体行为规划(规则与学习双轨)、Tier III 预测与规划交互。它系统梳理了自监督学习、多模态预训练、生成式数据增强等训练范式,并配套发布 WMAD 论文清单与基准。是当前入门自动驾驶世界模型最系统的地图。

2026年7月19日 · 3 分钟 · 595 字 · 

论文精读|SafeDiffuser:用控制障碍函数给扩散规划加上安全保证

SafeDiffuser 把控制论中的控制障碍函数(CBF)改造为有限时间扩散不变性,嵌入扩散去噪的每一步,为数据驱动的扩散规划器提供可证明的安全保证。它解决了扩散概率采样可能越界、约束只能’软学’、采样即赌博三大安全隐患。在迷宫、足式机器人、机械臂操作上验证了安全性与生成质量的兼得。

2026年7月19日 · 4 分钟 · 662 字 · 

论文精读|Diffusion Policy:扩散模型做机器人动作生成

Diffusion Policy 将机器人动作生成重新定义为条件去噪过程,让策略网络从噪声中逐步雕刻出动作序列。它天然支持多模态动作分布与高维动作空间,解决了传统行为克隆的 mode averaging 和复合误差问题。经 CNN 和 Transformer 双架构验证,成为后续 π0、Qwen-VLA 等 VLA 模型动作头设计的奠基之作。

2026年7月19日 · 5 分钟 · 854 字 · 

论文精读:DiffusionDriveV2 — RL-Constrained Truncated Diffusion

DiffusionDriveV2 将强化学习引入截断扩散模型,提出 Intra-Anchor GRPO 和 Inter-Anchor Truncated GRPO,解决了 DiffusionDrive 中多样性与一致高质量之间的根本矛盾。在 NAVSIM v1 上达到 91.2 PDMS,v2 上达到 85.5 EPDMS,均创下新纪录。

2026年7月19日 · 5 分钟 · 920 字 ·