Flow-GRPO 完全讲解:训练/推理/梯度流/Loss 设计的逐行拆解

从 train_flux_fast.py 第 1 行开始,逐层追踪 Flow-GRPO 的完整逻辑链:采样阶段做了什么?reward 怎么变成 advantage?训练阶段的计算图是怎么构造的?loss 为什么那样设计?梯度如何从最后一个 log_prob 传到 LoRA 参数?每段代码都标注了源文件行号。

2026年7月30日 · 24 分钟 · 5063 字 · 

AlpaMayo-R1 代码讲解:VLM 说推理链、Expert 雕轨迹、一个模型两套头

零基础逐文件拆解 NVIDIA AlpaMayo-R1 推理源码:从 VLM/Expert/Diffusion 三组件架构到单轮动力学动作空间,从 Flow Matching 去噪到 Fourier 特征编码,用伪代码 + 大白话讲清这个 10B 参数的 VLA 模型是怎么从传感器数据一路「推理」到轨迹输出的。

2026年7月22日 · 16 分钟 · 3268 字 · 

论文精读|TransDiffuser:去相关多模态表示驱动的扩散式轨迹生成

LiAuto 提出 TransDiffuser,用多模态表示去相关(Decorrelation)解决扩散轨迹生成中的模式坍缩问题。核心思路是强制多模态条件特征的维度去相关,让条件信号更丰富地覆盖潜空间,从而无需任何锚点轨迹或场景先验即可生成多样化轨迹。ResNet-34 + LiDAR 配置在 NAVSIM 上达到 PDMS 94.85。本文将用一张图一张图对应讲解的方式,把这篇论文的动机、架构、核心创新全部讲清楚。

2026年7月22日 · 5 分钟 · 968 字 · 

Diffusion Planner 代码讲解:轨迹级扩散 + 免训练能量引导

「Diffusion Planner 把规划对象从『动作』升级为『整条轨迹』,用 DiT + MLP-Mixer 去噪;亮点是在 DDPM 采样时注入 classifier guidance(碰撞/可行驶区域/运动学能量),无需重新训练就能把轨迹压进可行域,本文顺着官方仓库从名词、架构、逐文件逐函数一直讲到多模态闭环评测,帮零基础读者把『轨迹级扩散 + 免训练能量引导』这条主线彻底打通」

2026年7月20日 · 8 分钟 · 1524 字 · 

Diffusion Policy 代码讲解:用 DDPM 给机器人「生成」一连串动作

「Diffusion Policy 把『给一段观察、出一段动作序列』做成条件扩散生成:噪声动作被 ConditionalUnet1D 逐步去噪,训练是 DDPM 标准损失(预测加到数据上的噪声、MSE),推理是 DDIM 多步采样(20~100 步),归一化必做且推理要 unnormalize 回真实量纲。本文顺着 real-stanford 官方仓库,从名词速查、架构总览、项目结构,到 ConditionalUnet1D / diffusion / diffusion_unet1d_policy / base_dataset / train_diffusion_policy 逐文件逐函数细讲,并穿插『为什么多步动作更稳、为什么扩散天然多模态、为什么归一化是命门』等认知,最后落到它作为 DiffusionDrive / Diffusion Planner / pi0 方法论母体的位置,是一篇面向零基础、超详细、篇幅足够长的工程向代码讲解」

2026年7月20日 · 10 分钟 · 2044 字 · 

论文精读:FeaXDrive — Feasibility-aware Trajectory-Centric Diffusion Planning

FeaXDrive 发现噪声中心扩散规划与轨迹可行性空间存在根本错位,提出轨迹中心扩散框架,通过自适应曲率正则化训练、可行驶区域引导推理和可行性感知 GRPO 后训练系统提升轨迹物理可行性。在 NAVSIM 上达 88.7 PDMS (IL) / 90.0 PDMS (RL),曲率违反率从 8.59% 降至 0.88%。

2026年7月19日 · 4 分钟 · 800 字 · 

论文精读|X-World — 可控多相机世界模型实现可扩展端到端自动驾驶

端到端自动驾驶面临评测成本高、场景覆盖有限、难以复现的瓶颈。X-World 提出了一种以自我为中心的多视角生成式世界模型,通过动作条件化的多相机视频生成实现可控闭环仿真,在动作跟随度、跨视角一致性和长时序稳定性上取得了突破性表现。论文详细设计了两阶段级联训练策略、视角-时序自注意力机制和异构条件注入方案,为 VLA 系统的可扩展闭环评测与仿真训练提供了完整基础设施。

2026年7月18日 · 5 分钟 · 1005 字 ·