📄 论文信息

  • 标题NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning
  • 团队:Applied Intuition, Texas A&M University, UC Berkeley
  • arXiv2602.21172
  • 代码github.com/Applied-Open-Source/nord
  • 收录:CVPR 2026
  • 关键词:VLA, 数据效率, 免推理驾驶, Dr.GRPO, RL 后训练
  • 一句话总结NoRD 去掉了 VLA 中的推理环节,只用少量轨迹数据做 SFT + Dr.GRPO 强化学习,在 Waymo 和 NAVSIM 上取得可比性能,token 数减少 3 倍。

NoRD 训练流程对比:传统 VLA 需大规模推理数据,NoRD 仅需少量轨迹数据 + Dr.GRPO

NoRD 模型架构:直接预测动作 token,无中间推理

🤔 要解决什么问题?

当前 VLA 模型在自动驾驶中面临两个高昂的依赖:

依赖问题代价
大规模数据集需要数十万乃至百万级带标注驾驶样本采集和标注成本极高
推理标注需要 GPT-4o 等教师模型生成 CoT 推理链训练计算量大,推理延迟高

NoRD 的关键问题:自动驾驶真的需要"边想边开"吗?能否做到直接感知到动作的映射?

💡 核心思想

NoRD 的核心洞察有三层:

  1. 推理并非必要:模型可以在不生成中间推理文本的情况下直接预测轨迹,利用 VLM 内部的空间-时间先验即可
  2. 小数据 + 无推理的 SFT 策略足够作为起点:仅用 80K 样本(SOTA 方法的 <60%)即可训练基础策略
  3. 标准 GRPO 在弱策略上因难度偏差失效:Dr.GRPO 可修复这个问题

⚙️ 方法细节

训练流程对比

传统 VLA 流程: 大规模驾驶数据 → 教师 LLM 生成推理标注 → SFT 训练(含推理链)→ GRPO 强化学习

NoRD 流程: 小规模驾驶数据(80K 样本)→ SFT 训练(仅轨迹)→ Dr.GRPO 强化学习

难度偏差(Difficulty Bias)

这是本文最核心的分析发现:

标准 GRPO 的优势计算为:

$$ A_i = \frac{r_i - \mu}{\sigma} $$

对于弱策略产生的 rollout,简单场景(直线行驶)的 rollout 方差低,reward 稳定;复杂场景(急转弯、避障)的 rollout 方差高,reward 波动大。GRPO 用标准差 $\sigma$ 做归一化时,高方差场景的 reward 被严重惩罚,导致模型倾向于只学习简单场景,忽略困难场景。

场景类型Rollout 方差GRPO 优势学习效果
简单(直线)正常正常学习
复杂(转弯)被压制几乎不学习

Dr.GRPO 的改进

Dr.GRPO 移除了标准差分母,缓解难度偏差:

$$ A_i = r_i - \mu $$

这样高方差场景中偶尔成功的 rollout 也能获得正向优势信号,让弱策略能有效从困难场景中学习。

模型架构

  • 基座:Qwen-2.5VL-3B-Instruct
  • 输入:多视角 RGB 图像(前、前左、前右)+ 历史轨迹 token + 速度/加速度
  • 输出:使用 k-disc tokenized 词表直接预测未来 10Hz 轨迹

🧪 实验与结果

方法PDM Score训练数据量推理标注
UniPlan82.14~790K
HMVLM83.95~350K
AutoVLA84.12~460K
NoRD (SFT only)76.8880K
NoRD (SFT + GRPO)77.5580K
NoRD (SFT + Dr.GRPO)85.6080K

Dr.GRPO 带来了 11.68% 的显著提升,而标准 GRPO 仅有 0.67%。

WaymoE2E 结果

方法RFS数据量推理标注
Poutine7.91~680K
AutoVLA7.87~460K
NoRD (SFT only)7.2680K
NoRD (SFT + Dr.GRPO)7.5980K

Token 效率

方法Token 数推理延迟
AutoVLA (含推理)~900 tokens~400ms
EMMA (含推理)~750 tokens~380ms
NoRD~250 tokens~120ms

消融实验 — GRPO vs Dr.GRPO

策略PDM Gain说明
SFT baseline76.88基础
+ GRPO77.55 (+0.67%)几乎无提升
+ Dr.GRPO85.60 (+11.68%)显著提升

🎯 NoRD vs LinkVLA:两种哲学

维度NoRDLinkVLA
语言-动作关系去掉推理,直接映射强化对齐,双向绑定
对推理的态度不需要需要(但只是生成动作,非 CoT)
后训练Dr.GRPO纯 SFT
关键瓶颈难度偏差模态不对齐

⚠️ 局限与未来方向

  • 仅使用 Qwen2.5VL-3B,更大模型的表现有待验证
  • 在真实场景中的闭环比仿真更具挑战性
  • 无推理策略在极端长尾场景下的表现需进一步研究
  • Dr.GRPO 的超参数敏感性未充分分析

📝 个人思考

NoRD 最精彩的部分是对 GRPO 失效原因的诊断。难度偏差这个概念在 LLM 领域已被关注,但 NoRD 首次在自动驾驶 VLA 中揭示了它的影响。这个发现不仅对 NoRD 本身有价值,对所有用 RL 做 VLA 后训练的工作都有警示意义。

与 LinkVLA 对比来看,NoRD 走了相反的路——去掉冗余的中间环节。两篇同时被 CVPR 2026 接收,说明当前领域对 VLA 应该"多思考"还是"少思考"还存在根本分歧。我个人倾向于中间路线:保留轻量推理但不过度,同时用 RL 做端到端优化。

有趣的是,NoRD 来自工业界(Applied Intuition),LinkVLA 来自车企(理想汽车)。工业界对效率的极致追求在这里体现得很明显——每毫秒的延迟节省和每 MB 的计算量都有实际意义。


📖 这是论文精读系列的第 XX 篇。驾驶到底需不需要推理?这个问题的答案可能因场景而异。欢迎留言讨论。