论文精读|LinkVLA:统一语言-动作理解与生成的 VLA 架构
LinkVLA 提出将语言指令和驾驶轨迹统一到共享离散词表的 VLA 架构,通过对数坐标变换+空间软标签实现连续轨迹的离散化,引入动作理解反向目标建立双向语义映射,并用 C2F 两步解码替代逐点自回归。在 Bench2Drive (CARLA v2) 上 DS 达 91.01(超 SimLingo 5.94 分,+6.98%),推理延迟从 361ms 降到 48ms。主要作者来自浙大和理想汽车,收录于 CVPR 2026。
LinkVLA 提出将语言指令和驾驶轨迹统一到共享离散词表的 VLA 架构,通过对数坐标变换+空间软标签实现连续轨迹的离散化,引入动作理解反向目标建立双向语义映射,并用 C2F 两步解码替代逐点自回归。在 Bench2Drive (CARLA v2) 上 DS 达 91.01(超 SimLingo 5.94 分,+6.98%),推理延迟从 361ms 降到 48ms。主要作者来自浙大和理想汽车,收录于 CVPR 2026。