论文精读|π0:基于Flow Matching的通用视觉-语言-动作模型
π0 用预训练 VLM 做大脑、Flow Matching 做动作头,开创了 VLA 模型动作头设计的第三条路线。Flow Matching 相比扩散采样步数更少、训练更简单,相比离散化精度更高,巧妙弥合了 VLM 与连续机器人控制之间的表征鸿沟。在迄今最大规模机器人数据集上训练,一个模型搞定从叠衣服到收桌子的多种高难度操作。
π0 用预训练 VLM 做大脑、Flow Matching 做动作头,开创了 VLA 模型动作头设计的第三条路线。Flow Matching 相比扩散采样步数更少、训练更简单,相比离散化精度更高,巧妙弥合了 VLM 与连续机器人控制之间的表征鸿沟。在迄今最大规模机器人数据集上训练,一个模型搞定从叠衣服到收桌子的多种高难度操作。
Flow Matching 通过直接学习从噪声到数据的直线 ODE 路径,解决了扩散模型弯曲路径导致采样步数过多的问题。本文从数学直觉出发讲解向量场、ODE 与流的核心概念,并对比 CFM、Rectified Flow、OT路径等关键变体。与普通教程不同的是,本文所有代码均来自 ByteDance Bagel / Flow-GRPO 的真实项目实现,包含 CFG 推理、SDE 采样、GRPO 策略优化等工业级代码讲解。
Flow-GRPO 将 Group Relative Policy Optimization 引入流匹配策略训练,让扩散/流匹配模型不再只靠模仿学习,而是能通过奖励信号自主探索更优的驾驶策略。它采用 ODE-to-SDE 转换与 Denoising Reduction 技术,在 SD3、FLUX 等模型上验证了有效性。为生成式模型在自动驾驶规划中的强化学习优化提供了全新范式。
BrainWAM 用’大脑分工’的思路回答一个根本问题:VLA(语义推理)和 WAM(预测动态)到底该怎么结合?它先诊断出 Tri-MoT 朴素融合的致命伤——语义 token 抢占注意力、压垮预测信号;再受左右脑半球经胼胝体通信、小脑协调运动意图的启发,把语义和预测拆成两条特化通路,各自产出’面向动作’的表示,最后在紧凑的动作空间里用 CAB(胼胝体动作桥)双向交换、CIF(小脑意图融合)协调解码。NAVSIM v1 拿到 89.5 PDMS、v2 拿到 89.6 EPDMS,双双超过 VLA-only、WAM-only 和 Tri-MoT。
Metis 用 Mixture-of-Transformers 把’视频生成专家’和’动作预测专家’拆成两个独立 Transformer,再用一张非对称注意力掩码管理二者的信息流:动作只看向当前帧,未来视频可以看动作。训练时联合优化两者学到世界动态,推理时直接跳过视频生成只跑动作分支——NAVSIM-v2 navhard/navtest 和 CityWalker 全面 SOTA,纯动作推理比带视频快 8 倍,还零样本部署到四足机器人。
SimWAM 用 joint flow matching 把预训练视频专家的交通动态先验’蒸馏’进轻量级 Action Expert,再用隔离注意力掩码让动作分支彻底摆脱未来帧依赖;随后把确定性 Flow ODE 转成可探索的 SDE,用 GRPO 直接优化 NAVSIM 组合驾驶奖励,突破模仿学习的上限。91.5 PDMS 新 SOTA,推理时延大幅低于 imagine-then-act 的 WAM,并零样本迁移到 nuScenes。
DiffusionDrive 将扩散模型引入自动驾驶轨迹规划,从噪声出发逐步去噪生成多条合理轨迹,解决了确定性回归的 mode averaging 痛点。它通过轨迹初始化先验和截断扩散策略大幅减少采样步数,让扩散规划真正跑在车端。在闭环评测中达到生成式端到端驾驶的领先水平。
GoalFlow 用一个精准目标点词表加评分机制选出最合理的短期终点,再用 Flow Matching 一步生成多模态驾驶轨迹。它解决了纯扩散生成轨迹发散无边界、而固定锚点约束过强不真实的两难问题。在 NAVSIM 上 PDMS 达到 90.3,验证了’目标点+整流流’高效生成方案的有效性。
条件生成是扩散模型落地的关键能力,涉及如何将文本、图像、深度图、驾驶命令等条件信息注入生成过程。本文深入讲解 Classifier-Free Guidance 与 Classifier Guidance 的数学原理、条件注入的四种技术方案、驾驶场景中的多模态条件设计,以及截断扩散和 Flow Matching 等加速方案。
扩散模型与 Flow Matching 是当前生成式 AI 的两大核心范式。本文从 SDE 与 ODE 的统一视角出发,深入讲解扩散模型的随机微分方程解释、Flow Matching 的向量场学习方法、Rectified Flow 的路径整流机制,揭示扩散是 Flow Matching 的特殊情况。同时总结两者在自动驾驶场景生成与轨迹规划中的应用对比。