论文精读|NoRD:无需推理的高效数据驱动 VLA

NoRD 挑战 VLA 对大规模数据和推理标注的依赖,仅用 60% 数据 + 零推理标注即可达到可比性能。核心发现是标准 GRPO 在弱策略上由于难度偏差(Difficulty Bias)失效,引入 Dr.GRPO 后从 0.67% 提升扭转为 11.68% 的显著增益。

2026年7月24日 · 2 分钟 · 360 字 · 

论文精读|UniAD:面向规划的端到端自动驾驶框架(CVPR 2023最佳论文)

UniAD 首次将感知、预测、规划全部统一进一个可端到端联合训练的网络,以规划为最终目标反向驱动所有中间任务。它开创了显式端到端新范式,每个模块输出可解释的中间表示,并通过规划导向的联合优化全面提升系统一致性。获 CVPR 2023 最佳论文奖,是自动驾驶端到端路线里程碑式的奠基工作。

2026年7月18日 · 8 分钟 · 1667 字 · 

端到端自动驾驶:从模块化到一体化的演进

端到端自动驾驶将传感器输入直接映射到控制输出,消除了模块化方案中的误差累积与信息瓶颈问题。本文梳理从隐式端到端到显式端到端再到生成式大模型的三代架构演进,对比 UniAD、VAD、VLA 等代表性方案。为理解这一技术路线提供了完整的历史脉络与趋势展望。

2026年7月17日 · 4 分钟 · 706 字 · 

论文精读|DriveVLA-M0:失败感知的记忆增强,让 VLA 学会吃一堑长一智

DriveVLA-M0 给 VLA 自动驾驶加上了’失败记忆’:离线把模型表现差的场景连同路网/交互结构特征写进 latent memory,在线用专用的 Retrieve Model 检索结构相似的失败案例,再用解耦 LoRA 做测试时训练(TTT)逐场景纠正,让模型’吃一堑长一智’。NAVSIMv1 上 94.1 PDMS、NAVSIMv2 上 47.0 EPDMS,TTT 后向开销仅 26.44ms。它与同系 DriveVLA-W0 走了完全相反的路:W0 用世界模型换’稠密监督’,M0 用失败记忆换’场景自适应’。

2026年8月19日 · 7 分钟 · 1305 字 · 

论文精读|VLA Safety Survey:视觉-语言-动作模型安全的全面综述

这是首篇系统梳理 VLA 安全的综述,从攻击时机(训练时/推理时)和防御时机(训练时/推理时)两条平行轴组织文献,涵盖数据投毒、后门攻击、对抗补丁、跨模态扰动、语义越狱等威胁及对应防御,并讨论了 6 大部署领域的安全挑战。

2026年7月24日 · 1 分钟 · 173 字 · 

论文精读|AutoVLA:用自适应推理与 GRPO 微调统一「思考」与「动作」的端到端 VLA

AutoVLA(NeurIPS 2025, UCLA)把「链式推理 CoT」与「物理动作 token 化」塞进同一个自回归生成模型,用一套代码本把连续轨迹离散成可行动作,再用 SFT 训练出快思考(只出轨迹)与慢思考(带 CoT 推理)双模式,最后用 GRPO 强化微调在简单场景关掉多余推理。它是 NAVSIM v1 上 VLA 路线的代表基线(PDMS 89.1 / 92.1+锚点),也是 DriveVLA-W0 的主要对比对象。

2026年7月20日 · 2 分钟 · 393 字 · 

论文精读|DriveVLA-W0:世界模型放大自动驾驶数据缩放律

DriveVLA-W0 用世界模型给 VLA 大模型补上稠密监督,解决了大参数模型仅用稀疏轨迹信号训练的’监督赤字’问题。它同时预测未来动作和未来图像,用像素级稠密监督逼模型学懂物理动力学。单目前视相机即刷新 NAVSIM 榜单,证明了’世界模型放大数据缩放律’的路线可行性。

2026年7月19日 · 7 分钟 · 1308 字 · 

Flow Matching 入门详解:从扩散模型到连续动作生成(含代码讲解)

Flow Matching 通过直接学习从噪声到数据的直线 ODE 路径,解决了扩散模型弯曲路径导致采样步数过多的问题。本文从数学直觉出发讲解向量场、ODE 与流的核心概念,并对比 CFM、Rectified Flow、OT路径等关键变体。与普通教程不同的是,本文所有代码均来自 ByteDance Bagel / Flow-GRPO 的真实项目实现,包含 CFG 推理、SDE 采样、GRPO 策略优化等工业级代码讲解。

2026年7月18日 · 11 分钟 · 2135 字 · 

论文精读|DLWM:双潜在世界模型实现高斯中心的全方位预训练

DLWM 提出双阶段自监督预训练范式:第一阶段用多视图语义和深度重建学习 3D 高斯场景表示;第二阶段训练双潜在世界模型——高斯流引导的潜在预测(占据感知/预测)和自车规划引导的潜在预测(运动规划)。在 nuScenes 上占据预测 +1.02 mIoU,规划 L2 误差降低 16%。

2026年7月24日 · 2 分钟 · 266 字 · 

论文精读|AlpaMayo-R1:因果推理链 + RL 驱动的 VLA 驾驶策略

NVIDIA 提出 AlpaMayo-R1,一个融合 Chain of Causation 因果推理与 GRPO 强化学习的 VLA 模型。它基于 Cosmos-Reason VLM 骨干,通过结构化 CoC 数据集实现决策锚定的因果推理,利用 Flow Matching 动作解码器生成连续轨迹。三阶段训练(动作注入→推理微调→RL后训练)在长尾场景中取得显著提升:规划准确率 +12%,近距离冲突率 -35%,推理质量 +45%。真车路测延迟仅 99ms。

2026年7月22日 · 5 分钟 · 873 字 · 

BEV 感知技术详解:自动驾驶的鸟瞰图视角

BEV 感知将多摄像头画面统一重投影到以自车为中心的鸟瞰图空间,解决了透视图像到度量空间的根本矛盾。本文详细讲解 LSS 与 Transformer 两条主流视角变换路线,以及 BEVFormer 等代表方法的架构设计。BEV 已是现代端到端自动驾驶感知系统的事实标准中间表示。

2026年7月18日 · 3 分钟 · 607 字 · 

论文精读|RAW2Drive:对齐世界模型的强化学习端到端驾驶

RAW2Drive 提出双流模型基强化学习框架,先用特权信息(BEV 语义)高效训练特权世界模型+策略,再通过对齐机制引导原始传感器世界模型的学习,实现首个从原始传感器直接规划端到端 MBRL 方法。在 Bench2Drive 上 DS 达 83.5,超越所有原始传感器基线。

2026年7月24日 · 2 分钟 · 300 字 · 

NAVSIM 详解:自动驾驶规划的事实标准评测基准

NAVSIM 是当前自动驾驶规划领域最重要的开环评测基准,几乎所有端到端新工作都在上面比拼 PDMS 分数。它基于 OpenScene 数据设计了非反应式仿真框架,以 PDMS/EPDMS 为核心指标抛弃传统 L2 误差思路。是端到端规划从学术研究走向工业落地的关键度量工具。

2026年7月19日 · 14 分钟 · 2975 字 · 

论文精读|NVIDIA Cosmos 3:全模态世界基础模型开启物理AI新纪元

NVIDIA Cosmos 3 用 Mixture-of-Transformers 双塔架构将语言、图像、视频、音频、动作五模态统一进单一世界基础模型。Reasoner 塔负责语义推理,Generator 塔负责高保真生成,两塔通过共享跨模态注意力深度耦合。在 8 项物理 AI 基准上取得开放模型第一,并以 OpenMDW-1.1 宽松许可证开源。

2026年7月19日 · 4 分钟 · 697 字 · 

自动驾驶 3D 坐标系统详解:从传感器到世界

3D 坐标系统是自动驾驶感知的数学基石。本文详解六大坐标系(世界、自车、相机、LiDAR、BEV、图像像素)的定义与变换关系,覆盖针孔投影、内外参标定、3D↔2D 投影流程,以及 BEVFormer 等模型中的坐标变换设计。理解坐标系统就等于理解了感知流水线的数学骨架。

2026年7月19日 · 3 分钟 · 607 字 · 

论文精读|Percept-WAM:把 2D/3D 感知'种'进 VLM 里的感知增强世界动作模型

Percept-WAM 回答的是 WAM 系列的另一个致命问题:VLM 的空间感太差——‘定位漂移、时序不一致、置信度虚高’,导致 VLA 系统的感知和规划都不稳。它把 2D/3D 感知任务直接’种’进单个 VLM 里:用 World-PV token(透视视角)和 World-BEV token(鸟瞰视角)编码可定位的世界状态,配合网格条件化预测头、IoU 校准置信度和并行自回归解码,再用四组点级 query(Q_pv/Q_bev/Q_ego/Q_full)把感知表示对齐成轨迹。NAVSIM v1 拿到 90.2 PDMS,超过 DiffusionDrive 2.1,还配了流式推理把时延压到 707ms。

2026年8月19日 · 7 分钟 · 1480 字 · 

论文精读|MOSAIC:面向端到端自动驾驶的缩放感知数据选择

MOSAIC 提出三阶段数据选择框架:聚类分域 → 拟合神经缩放定律 → 迭代选择最大化指标边际增益。在 NAVSIM 上使用 Hydra-MDP 模型,以 42% 更少数据达到全量训练性能,EPDMS 最优。来自 NVIDIA 和 NYU 的 CVPR 2026 工作。

2026年7月24日 · 2 分钟 · 250 字 · 

Flow-GRPO 详解:流匹配策略的强化学习优化

Flow-GRPO 将 Group Relative Policy Optimization 引入流匹配策略训练,让扩散/流匹配模型不再只靠模仿学习,而是能通过奖励信号自主探索更优的驾驶策略。它采用 ODE-to-SDE 转换与 Denoising Reduction 技术,在 SD3、FLUX 等模型上验证了有效性。为生成式模型在自动驾驶规划中的强化学习优化提供了全新范式。

2026年7月19日 · 6 分钟 · 1154 字 · 

论文精读|SparseDriveV2:Scoring is All You Need——可扩展轨迹词表与打分

SparseDriveV2 把’打分式规划’推向极致:把时空轨迹分解成几何路径✕速度剖面两份词表,用组合式构图构造出比此前稠密 32 倍的超密集轨迹词表;再配合’粗粒度分解打分 + 细粒度组合打分’的可扩展打分策略,让打分计算量与词表大小解耦。在 NAVSIM v2 上达到 90.1 EPDMS,位居打分式与生成式方法的 SOTA。

2026年7月19日 · 2 分钟 · 424 字 · 

在线地图构建基础:从传感器到结构化地图

在线高精地图构建是自动驾驶感知的核心模块之一,它从传感器数据中实时重建车道线、边界、路口等道路元素。本文详解 HDMapNet、MapTR、VectorMapNet 等代表性方案的技术路线,覆盖分割→向量化、端到端 Transformer 解析、车道图构建,以及地图在规划中的约束作用。

2026年7月19日 · 2 分钟 · 378 字 ·