论文精读|LinkVLA:统一语言-动作理解与生成的 VLA 架构

LinkVLA 提出将语言指令和驾驶轨迹统一到共享离散词表的 VLA 架构,通过对数坐标变换+空间软标签实现连续轨迹的离散化,引入动作理解反向目标建立双向语义映射,并用 C2F 两步解码替代逐点自回归。在 Bench2Drive (CARLA v2) 上 DS 达 91.01(超 SimLingo 5.94 分,+6.98%),推理延迟从 361ms 降到 48ms。主要作者来自浙大和理想汽车,收录于 CVPR 2026。

2026年7月24日 · 7 分钟 · 1294 字 ·