论文精读|π0:基于Flow Matching的通用视觉-语言-动作模型

π0 用预训练 VLM 做大脑、Flow Matching 做动作头,开创了 VLA 模型动作头设计的第三条路线。Flow Matching 相比扩散采样步数更少、训练更简单,相比离散化精度更高,巧妙弥合了 VLM 与连续机器人控制之间的表征鸿沟。在迄今最大规模机器人数据集上训练,一个模型搞定从叠衣服到收桌子的多种高难度操作。

2026年7月18日 · 3 分钟 · 580 字 · 

Flow Matching 入门详解:从扩散模型到连续动作生成(含代码讲解)

Flow Matching 通过直接学习从噪声到数据的直线 ODE 路径,解决了扩散模型弯曲路径导致采样步数过多的问题。本文从数学直觉出发讲解向量场、ODE 与流的核心概念,并对比 CFM、Rectified Flow、OT路径等关键变体。与普通教程不同的是,本文所有代码均来自 ByteDance Bagel / Flow-GRPO 的真实项目实现,包含 CFG 推理、SDE 采样、GRPO 策略优化等工业级代码讲解。

2026年7月18日 · 11 分钟 · 2135 字 · 

Flow-GRPO 详解:流匹配策略的强化学习优化

Flow-GRPO 将 Group Relative Policy Optimization 引入流匹配策略训练,让扩散/流匹配模型不再只靠模仿学习,而是能通过奖励信号自主探索更优的驾驶策略。它采用 ODE-to-SDE 转换与 Denoising Reduction 技术,在 SD3、FLUX 等模型上验证了有效性。为生成式模型在自动驾驶规划中的强化学习优化提供了全新范式。

2026年7月19日 · 6 分钟 · 1154 字 · 

论文精读|BrainWAM:大脑式'动作空间协调'——把 VLA 语义先验和 WAM 预测动态拧成一股绳

BrainWAM 用’大脑分工’的思路回答一个根本问题:VLA(语义推理)和 WAM(预测动态)到底该怎么结合?它先诊断出 Tri-MoT 朴素融合的致命伤——语义 token 抢占注意力、压垮预测信号;再受左右脑半球经胼胝体通信、小脑协调运动意图的启发,把语义和预测拆成两条特化通路,各自产出’面向动作’的表示,最后在紧凑的动作空间里用 CAB(胼胝体动作桥)双向交换、CIF(小脑意图融合)协调解码。NAVSIM v1 拿到 89.5 PDMS、v2 拿到 89.6 EPDMS,双双超过 VLA-only、WAM-only 和 Tri-MoT。

2026年8月19日 · 9 分钟 · 1852 字 · 

论文精读|Metis:用'非对称注意力掩码'把视频生成与动作预测解耦的世界动作模型

Metis 用 Mixture-of-Transformers 把’视频生成专家’和’动作预测专家’拆成两个独立 Transformer,再用一张非对称注意力掩码管理二者的信息流:动作只看向当前帧,未来视频可以看动作。训练时联合优化两者学到世界动态,推理时直接跳过视频生成只跑动作分支——NAVSIM-v2 navhard/navtest 和 CityWalker 全面 SOTA,纯动作推理比带视频快 8 倍,还零样本部署到四足机器人。

2026年8月17日 · 7 分钟 · 1360 字 · 

论文精读|SimWAM:把世界模型当'训练老师',用 Flow-GRPO 让 Action Expert 学会'自己开车'

SimWAM 用 joint flow matching 把预训练视频专家的交通动态先验’蒸馏’进轻量级 Action Expert,再用隔离注意力掩码让动作分支彻底摆脱未来帧依赖;随后把确定性 Flow ODE 转成可探索的 SDE,用 GRPO 直接优化 NAVSIM 组合驾驶奖励,突破模仿学习的上限。91.5 PDMS 新 SOTA,推理时延大幅低于 imagine-then-act 的 WAM,并零样本迁移到 nuScenes。

2026年8月17日 · 12 分钟 · 2408 字 · 

论文精读|DiffusionDrive:扩散模型驱动的端到端轨迹规划

DiffusionDrive 将扩散模型引入自动驾驶轨迹规划,从噪声出发逐步去噪生成多条合理轨迹,解决了确定性回归的 mode averaging 痛点。它通过轨迹初始化先验和截断扩散策略大幅减少采样步数,让扩散规划真正跑在车端。在闭环评测中达到生成式端到端驾驶的领先水平。

2026年7月19日 · 3 分钟 · 573 字 · 

论文精读|GoalFlow:目标引导流匹配轨迹生成

GoalFlow 用一个精准目标点词表加评分机制选出最合理的短期终点,再用 Flow Matching 一步生成多模态驾驶轨迹。它解决了纯扩散生成轨迹发散无边界、而固定锚点约束过强不真实的两难问题。在 NAVSIM 上 PDMS 达到 90.3,验证了’目标点+整流流’高效生成方案的有效性。

2026年7月19日 · 3 分钟 · 509 字 · 

知识点拆解|条件扩散模型详解:引导方法与条件注入技术

条件生成是扩散模型落地的关键能力,涉及如何将文本、图像、深度图、驾驶命令等条件信息注入生成过程。本文深入讲解 Classifier-Free Guidance 与 Classifier Guidance 的数学原理、条件注入的四种技术方案、驾驶场景中的多模态条件设计,以及截断扩散和 Flow Matching 等加速方案。

2026年7月19日 · 4 分钟 · 749 字 · 

知识点拆解|Flow Matching 与扩散模型统一视角:从 SDE 到 ODE 的生成范式

扩散模型与 Flow Matching 是当前生成式 AI 的两大核心范式。本文从 SDE 与 ODE 的统一视角出发,深入讲解扩散模型的随机微分方程解释、Flow Matching 的向量场学习方法、Rectified Flow 的路径整流机制,揭示扩散是 Flow Matching 的特殊情况。同时总结两者在自动驾驶场景生成与轨迹规划中的应用对比。

2026年7月19日 · 5 分钟 · 940 字 ·