Flow-GRPO 完全讲解:训练/推理/梯度流/Loss 设计的逐行拆解
从 train_flux_fast.py 第 1 行开始,逐层追踪 Flow-GRPO 的完整逻辑链:采样阶段做了什么?reward 怎么变成 advantage?训练阶段的计算图是怎么构造的?loss 为什么那样设计?梯度如何从最后一个 log_prob 传到 LoRA 参数?每段代码都标注了源文件行号。
从 train_flux_fast.py 第 1 行开始,逐层追踪 Flow-GRPO 的完整逻辑链:采样阶段做了什么?reward 怎么变成 advantage?训练阶段的计算图是怎么构造的?loss 为什么那样设计?梯度如何从最后一个 log_prob 传到 LoRA 参数?每段代码都标注了源文件行号。