论文精读|LinkVLA:统一语言-动作理解与生成的 VLA 架构
LinkVLA 提出将语言指令和驾驶轨迹统一到共享离散词表的 VLA 架构,通过对数坐标变换+空间软标签实现连续轨迹的离散化,引入动作理解反向目标建立双向语义映射,并用 C2F 两步解码替代逐点自回归。在 Bench2Drive (CARLA v2) 上 DS 达 91.01(超 SimLingo 5.94 分,+6.98%),推理延迟从 361ms 降到 48ms。主要作者来自浙大和理想汽车,收录于 CVPR 2026。
LinkVLA 提出将语言指令和驾驶轨迹统一到共享离散词表的 VLA 架构,通过对数坐标变换+空间软标签实现连续轨迹的离散化,引入动作理解反向目标建立双向语义映射,并用 C2F 两步解码替代逐点自回归。在 Bench2Drive (CARLA v2) 上 DS 达 91.01(超 SimLingo 5.94 分,+6.98%),推理延迟从 361ms 降到 48ms。主要作者来自浙大和理想汽车,收录于 CVPR 2026。
DriveVLM 是首个系统性地把视觉语言模型用于自动驾驶场景理解与推理的工作。它提出双系统架构——VLM 慢系统做思维链推理输出高层决策,传统规划器快系统做安全执行。在 CARLA 闭环评测中大幅超越基线,为 VLA 的 Dual-System 范式奠定基础。
ST4VLA 提出双阶段空间引导训练框架:第一阶段用点、框、轨迹预测进行空间接地预训练注入空间先验;第二阶段用空间提示引导动作生成。在 SimplerEnv 上 Google Robot 从 66.1 提升到 84.6,WidowX 从 54.7 提升到 73.2,并展现对未见物体和复杂长时任务的强泛化。
π0 用预训练 VLM 做大脑、Flow Matching 做动作头,开创了 VLA 模型动作头设计的第三条路线。Flow Matching 相比扩散采样步数更少、训练更简单,相比离散化精度更高,巧妙弥合了 VLM 与连续机器人控制之间的表征鸿沟。在迄今最大规模机器人数据集上训练,一个模型搞定从叠衣服到收桌子的多种高难度操作。
NoRD 挑战 VLA 对大规模数据和推理标注的依赖,仅用 60% 数据 + 零推理标注即可达到可比性能。核心发现是标准 GRPO 在弱策略上由于难度偏差(Difficulty Bias)失效,引入 Dr.GRPO 后从 0.67% 提升扭转为 11.68% 的显著增益。
UniAD 首次将感知、预测、规划全部统一进一个可端到端联合训练的网络,以规划为最终目标反向驱动所有中间任务。它开创了显式端到端新范式,每个模块输出可解释的中间表示,并通过规划导向的联合优化全面提升系统一致性。获 CVPR 2023 最佳论文奖,是自动驾驶端到端路线里程碑式的奠基工作。
DriveVLA-M0 给 VLA 自动驾驶加上了’失败记忆’:离线把模型表现差的场景连同路网/交互结构特征写进 latent memory,在线用专用的 Retrieve Model 检索结构相似的失败案例,再用解耦 LoRA 做测试时训练(TTT)逐场景纠正,让模型’吃一堑长一智’。NAVSIMv1 上 94.1 PDMS、NAVSIMv2 上 47.0 EPDMS,TTT 后向开销仅 26.44ms。它与同系 DriveVLA-W0 走了完全相反的路:W0 用世界模型换’稠密监督’,M0 用失败记忆换’场景自适应’。
这是首篇系统梳理 VLA 安全的综述,从攻击时机(训练时/推理时)和防御时机(训练时/推理时)两条平行轴组织文献,涵盖数据投毒、后门攻击、对抗补丁、跨模态扰动、语义越狱等威胁及对应防御,并讨论了 6 大部署领域的安全挑战。
AutoVLA(NeurIPS 2025, UCLA)把「链式推理 CoT」与「物理动作 token 化」塞进同一个自回归生成模型,用一套代码本把连续轨迹离散成可行动作,再用 SFT 训练出快思考(只出轨迹)与慢思考(带 CoT 推理)双模式,最后用 GRPO 强化微调在简单场景关掉多余推理。它是 NAVSIM v1 上 VLA 路线的代表基线(PDMS 89.1 / 92.1+锚点),也是 DriveVLA-W0 的主要对比对象。
DriveVLA-W0 用世界模型给 VLA 大模型补上稠密监督,解决了大参数模型仅用稀疏轨迹信号训练的’监督赤字’问题。它同时预测未来动作和未来图像,用像素级稠密监督逼模型学懂物理动力学。单目前视相机即刷新 NAVSIM 榜单,证明了’世界模型放大数据缩放律’的路线可行性。
DLWM 提出双阶段自监督预训练范式:第一阶段用多视图语义和深度重建学习 3D 高斯场景表示;第二阶段训练双潜在世界模型——高斯流引导的潜在预测(占据感知/预测)和自车规划引导的潜在预测(运动规划)。在 nuScenes 上占据预测 +1.02 mIoU,规划 L2 误差降低 16%。
NVIDIA 提出 AlpaMayo-R1,一个融合 Chain of Causation 因果推理与 GRPO 强化学习的 VLA 模型。它基于 Cosmos-Reason VLM 骨干,通过结构化 CoC 数据集实现决策锚定的因果推理,利用 Flow Matching 动作解码器生成连续轨迹。三阶段训练(动作注入→推理微调→RL后训练)在长尾场景中取得显著提升:规划准确率 +12%,近距离冲突率 -35%,推理质量 +45%。真车路测延迟仅 99ms。
RAW2Drive 提出双流模型基强化学习框架,先用特权信息(BEV 语义)高效训练特权世界模型+策略,再通过对齐机制引导原始传感器世界模型的学习,实现首个从原始传感器直接规划端到端 MBRL 方法。在 Bench2Drive 上 DS 达 83.5,超越所有原始传感器基线。
NVIDIA Cosmos 3 用 Mixture-of-Transformers 双塔架构将语言、图像、视频、音频、动作五模态统一进单一世界基础模型。Reasoner 塔负责语义推理,Generator 塔负责高保真生成,两塔通过共享跨模态注意力深度耦合。在 8 项物理 AI 基准上取得开放模型第一,并以 OpenMDW-1.1 宽松许可证开源。
Percept-WAM 回答的是 WAM 系列的另一个致命问题:VLM 的空间感太差——‘定位漂移、时序不一致、置信度虚高’,导致 VLA 系统的感知和规划都不稳。它把 2D/3D 感知任务直接’种’进单个 VLM 里:用 World-PV token(透视视角)和 World-BEV token(鸟瞰视角)编码可定位的世界状态,配合网格条件化预测头、IoU 校准置信度和并行自回归解码,再用四组点级 query(Q_pv/Q_bev/Q_ego/Q_full)把感知表示对齐成轨迹。NAVSIM v1 拿到 90.2 PDMS,超过 DiffusionDrive 2.1,还配了流式推理把时延压到 707ms。
MOSAIC 提出三阶段数据选择框架:聚类分域 → 拟合神经缩放定律 → 迭代选择最大化指标边际增益。在 NAVSIM 上使用 Hydra-MDP 模型,以 42% 更少数据达到全量训练性能,EPDMS 最优。来自 NVIDIA 和 NYU 的 CVPR 2026 工作。
SparseDriveV2 把’打分式规划’推向极致:把时空轨迹分解成几何路径✕速度剖面两份词表,用组合式构图构造出比此前稠密 32 倍的超密集轨迹词表;再配合’粗粒度分解打分 + 细粒度组合打分’的可扩展打分策略,让打分计算量与词表大小解耦。在 NAVSIM v2 上达到 90.1 EPDMS,位居打分式与生成式方法的 SOTA。
BrainWAM 用’大脑分工’的思路回答一个根本问题:VLA(语义推理)和 WAM(预测动态)到底该怎么结合?它先诊断出 Tri-MoT 朴素融合的致命伤——语义 token 抢占注意力、压垮预测信号;再受左右脑半球经胼胝体通信、小脑协调运动意图的启发,把语义和预测拆成两条特化通路,各自产出’面向动作’的表示,最后在紧凑的动作空间里用 CAB(胼胝体动作桥)双向交换、CIF(小脑意图融合)协调解码。NAVSIM v1 拿到 89.5 PDMS、v2 拿到 89.6 EPDMS,双双超过 VLA-only、WAM-only 和 Tri-MoT。
Metis 用 Mixture-of-Transformers 把’视频生成专家’和’动作预测专家’拆成两个独立 Transformer,再用一张非对称注意力掩码管理二者的信息流:动作只看向当前帧,未来视频可以看动作。训练时联合优化两者学到世界动态,推理时直接跳过视频生成只跑动作分支——NAVSIM-v2 navhard/navtest 和 CityWalker 全面 SOTA,纯动作推理比带视频快 8 倍,还零样本部署到四足机器人。
SimWAM 用 joint flow matching 把预训练视频专家的交通动态先验’蒸馏’进轻量级 Action Expert,再用隔离注意力掩码让动作分支彻底摆脱未来帧依赖;随后把确定性 Flow ODE 转成可探索的 SDE,用 GRPO 直接优化 NAVSIM 组合驾驶奖励,突破模仿学习的上限。91.5 PDMS 新 SOTA,推理时延大幅低于 imagine-then-act 的 WAM,并零样本迁移到 nuScenes。