技术博客

自动驾驶 VLA · 世界模型 · 端到端 · 前沿论文精读与知识分享

📅 2026
JUL 19
论文精读|VLA for Autonomous Driving:自动驾驶视觉-语言-动作模型的过去、现在与未来
这份 47 页的综述首次为自动驾驶 VLA 建立了系统形式化与分类法,从 VA(视觉-动作)到 VLA(视觉-语言-动作)理清演进线。它提出端到端 VLA 与双系统 VLA 两大范式分类,并统一梳理了动作空间四分法、数据集基准与评测协议。是当前自动驾驶 VLA 领域最权威的架构脉络地图和未来挑战指南。
📚 综述 🧠 VLA 🔁 端到端 🚗 自动驾驶
JUL 19
论文精读|World4Drive:用意图感知的物理隐世界模型,摆脱感知标注做端到端规划
World4Drive 是首个将多模态驾驶意图与物理隐世界模型结合的端到端框架,无需 3D 框/高精地图等昂贵感知标注。它借 Grounded-SAM 的语义先验和 Metric3D 的深度先验构建'懂物理'的隐空间,让模型在多种驾驶意图下想象未来、用世界模型打分选最优轨迹。L2 误差降 18.1%、碰撞率降 46.7%、收敛快 3.75 倍,被 ICCV 2025 收录。
🌍 世界模型 🚫 无感知标注 🎯 意图感知 🚗 端到端
JUL 19
论文精读|Diffusion Policy:扩散模型做机器人动作生成
Diffusion Policy 将机器人动作生成重新定义为条件去噪过程,让策略网络从噪声中逐步雕刻出动作序列。它天然支持多模态动作分布与高维动作空间,解决了传统行为克隆的 mode averaging 和复合误差问题。经 CNN 和 Transformer 双架构验证,成为后续 π0、Qwen-VLA 等 VLA 模型动作头设计的奠基之作。
🎨 扩散模型 🤖 机器人 ⚡ 动作生成 🔮 策略学习
JUL 19
论文精读|WCog-VLA:双层级世界认知,让自动驾驶从被动反应走向主动博弈
WCog-VLA 是首个桥接语义层世界预测与生成层世界演化的 VLA 框架,将 VLA 从被动反应推向主动博弈。语义层用 agent token+Game-CoT(Stackelberg 博弈思维链)做世界预测与意图推理,生成层用对齐解耦扩散 Transformer 合成多智能体联合轨迹。在 NAVSIM 刷新 PDMS 92.9 的 SOTA,证明双层级世界认知是 VLA 进阶的关键方向。
🧠 世界模型 🎮 博弈推理 🌀 扩散规划 🚗 端到端
JUL 19
论文精读|VADv2:概率规划——把驾驶决策从"猜唯一答案"变成"算概率分布"
VADv2 把驾驶规划从'猜唯一答案'的确定性回归改造成'算所有动作的概率分布再采样'的概率规划范式。它用规划词表离散化连续动作空间、用概率场函数建模场景与动作的关联,天然处理多模态非凸解空间。在 CARLA Town05 将 Drive Score 从 76.1 拉到 85.1,且无需任何规则后处理,被 ICLR 2026 接收。
🧩 概率规划 🔤 规划词表 🔗 端到端 🚗 自动驾驶 🎲 不确定性建模
JUL 19
论文精读|nuTruck:面向分布式电驱重卡的自动驾驶规划闭环基准
nuTruck 是首个面向分布式电驱重卡(DET)的规划训练与闭环评测基准,填补了学习型规划器在重卡领域被忽视的安全空白。它构建三轴六轮高保真非线性动力学模型并引入侧翻风险指标 LTR 与 NRS,证明了乘用车时代的'无碰撞即安全'假设在重卡上完全失效。核心发现:规划层必须考虑动力学安全,下游控制器无法兜底。
重卡自动驾驶 动力学安全 闭环评测 规划基准 侧翻
JUL 19
VLA-World精读:统一预测想象与反思推理的视觉-语言-行动世界模型
VLA-World 通过将 VLA 的推理能力与世界模型的预测想象统一在单一框架中,实现了预测-生成-反思-规划的完整闭环。它利用动作驱动的可行轨迹引导下一帧图像生成,再对自生成的未来帧进行推理以修正轨迹,在 nuScenes 的规划和生成基准上均达到 SOTA。
🧠 VLA 🌍 世界模型 🎯 GRPO 🚗 自动驾驶 🏆 CVPR 2026 Findings
JUL 19
RT-2精读:VLA奠基之作——将网络知识迁移到机器人控制
RT-2 由 Google DeepMind 提出,首次将互联网预训练的 VLM 通过动作编码为文本 Token 的方式转化为 VLA 模型。它开创性地用机器人数据微调大规模图文模型,让网络知识迁移到具身控制,使机器人具备语义理解和零样本泛化能力。在 6k 次真机试验中验证了涌现的语义推理和从未见过的任务执行能力,是 VLA 范式的奠基之作。
🧠 VLA 🏭 Google 🤖 机器人 ⚡ 基础模型
JUL 19
CoWorld-VLA精读:多专家世界模型中的自动驾驶推理
CoWorld-VLA 在 VLM 隐空间中构建多专家 Latent CoT 推理框架,解决了文本 CoT 丢失空间信息而隐空间缺乏可条件化信号的根本矛盾。它通过语义交互、几何结构、动态演化与轨迹意图四种专家 Token,将互补的世界知识编码为显式可用的规划条件。在 NAVSIM v1 上达到 89.8 PDMS,证明了结构化隐式推理的有效性。
🧠 VLA 🌍 世界模型 🤝 协作 🚗 自动驾驶
JUL 19
论文精读|LingBot-VLA:务实的 VLA 基础模型
LingBot-VLA 以'务实'为核心设计哲学,用 9 种双臂构型、约 2 万小时真机数据训出一个跨平台 VLA 基础模型。它通过跨构型预训练学出与具体硬件解耦的动作策略,辅以开源高效代码库(8 卡 261 样本/秒)和 GM-100 基准。在 4 个平台 100 类任务上展现强泛化能力,将 VLA 从论文模型推向产线工具。
🧠 VLA 🤖 具身智能 🏭 乐博尼克 🦾 双臂机器人 📦 开源
JUL 19
论文精读|Vesta:统一的具身推理通用模型
NVIDIA 的 Vesta 用单一 Qwen3-VL-8B 基础模型统一定位、空间推理、导航和长程规划四大具身智能能力,取代了传统的拼装专家路线。它通过统一的条件语言生成范式和简洁的多模态记忆挽具,让自注意力在历史帧与当前观察间建立长程依赖。平均超越各类别最优专家 20% 以上,真机任务成功率提升超 35%。
🤖 具身智能 🧠 通用模型 🗺️ 导航 🧩 推理 🏭 NVIDIA
JUL 19
论文精读|K-Risk:知识增强的高风险驾驶场景数据集
K-Risk 整合欧美中三大洲 20 个轨迹数据集,用 DRF 驱动风险筛选流水线统一抽取高风险事件。它通过 LLM 为每个事件生成三元组标注(结构化描述+异常行为通知+经闭环仿真器验证的因果风险分析),首次将高风险事件标签、语义标注和可验证决策信号三合一打包。产出 31,398 个高风险事件和 1,036 个极端近碰撞子集,为风险感知自动驾驶提供标准化评测基础。
🚗 自动驾驶 📦 数据集 ⚠️ 安全 🤖 LLM标注 🔍 风险推理
JUL 19
论文精读|Agent-driven Long-tail Simulation for Autonomous Driving:用 LLM 代理驱动自动驾驶长尾仿真
本文用指令跟随 LLM 代理接管仿真器中所有交通参与者,抛弃了日志回放和规则代理的传统仿真范式。LLM 通过结构化动作接口控制每辆车的目标速度、车道与让行行为,配合 Flow-Matching 轨迹生成器实现高保真物理执行。配套的 SemanticPlan 长尾语义闭环基准暴露出 SOTA 规划器在意图性交互场景中仍频繁翻车的短板。
🚗 自动驾驶 🎭 仿真 🤖 LLM代理 📊 基准测试 🔁 闭环评估
JUL 19
论文精读|ExploreVLA:密集世界建模与探索驱动的端到端自动驾驶
VLA 模型通过行为克隆学习驾驶策略,但受限于模仿学习无法探索专家分布之外的高质量策略。ExploreVLA 提出统一的理解-生成框架:用未来 RGB + 深度图生成作为密集世界建模目标,再利用世界模型的图像预测不确定性作为内在探索奖励,通过安全门控的 GRPO 优化策略。在 NAVSIM 上达到 93.7 PDMS 和 88.8 EPDMS。
VLA 世界模型 GRPO 强化学习 端到端自动驾驶
JUL 19
论文精读|ABot-M0.5:统一的移动操作世界动作模型
ABot-M0.5 用'三层对齐'策略重新设计了移动操作的世界动作模型:潜在动作模块在帧级粒度捕捉视觉状态转移,解决时间粒度粗糙导致的精细接触丢失。双层 Mixture-of-Transformers 解耦导航与操作的动作空间,dream-forcing 训练策略打通训练与推理的分布鸿沟。在长程任务和精细控制上同时达到 SOTA。
🤖 具身智能 🔮 世界模型 🦾 移动操作 🧠 VLA 🗺️ 高德
JUL 19
论文精读|From Foundation to Application: Improving VLA Models in Practice(LingBot-VLA 2.0)
蚂蚁 LingBot-VLA 2.0 在数据、动作空间、预测建模三个维度同时补课:6 万小时多本体预训练数据覆盖 9 种构型,全身自由度动作空间支持头部/腰部/底盘/灵巧手协同控制,双查询蒸馏赋予模型向前看的预测能力。Token 级稀疏 MoE 动作专家有效解耦多本体异构动力学。在 GM-100 双臂基准与长程移动操作上全面领先 π0.5。
🤖 具身智能 🧠 VLA 🏭 蚂蚁机器人 🔀 MoE 🎯 跨本体
JUL 19
论文精读|Teaching VLA Models What to See and Where to Look:DriveTeach-VLA 的视觉教学三段式
DriveTeach-VLA 指出驾驶 VLA 的瓶颈不在语言推理而在视觉空间 grounding,核心问题不是'想不清'而是'看不对'。它提出三段式视觉教学管线——DVD 蒸馏教模型'看什么'、2D 轨迹引导提示教'往哪看'、TGP-guided GRPO 教'怎么动'——层层递进注入驾驶感知先验。在 Qwen2.5-VL 上刷新 NAVSIM 与 nuScenes 双榜单 SOTA。
🧠 VLA 🏫 教学 🚗 自动驾驶
JUL 19
论文精读|MVAdapt:零样本多车型适应的端到端自动驾驶
MVAdapt 揭示了端到端自动驾驶的'车辆域差距':模型隐式绑定了训练车的动力学特性,换车即翻车。它用轻量物理编码器编码轴距、质量、驱动方式等物理属性,通过交叉注意力注入冻结的场景编码器,在不损失视觉泛化能力的前提下实现跨车型适应。在 58 种车型上的零样本迁移表现大幅领先 naive transfer 和 URMA 等基线。
🚗 自动驾驶 🔁 端到端 🎯 领域自适应 🧠 TransFuser 📐 车辆动力学
JUL 19
论文精读|SafeDiffuser:用控制障碍函数给扩散规划加上安全保证
SafeDiffuser 把控制论中的控制障碍函数(CBF)改造为有限时间扩散不变性,嵌入扩散去噪的每一步,为数据驱动的扩散规划器提供可证明的安全保证。它解决了扩散概率采样可能越界、约束只能'软学'、采样即赌博三大安全隐患。在迷宫、足式机器人、机械臂操作上验证了安全性与生成质量的兼得。
🎨 扩散模型 🛡️ 安全 📐 规划 🤖 具身智能
JUL 19
论文精读|A Survey of World Models for Autonomous Driving:自动驾驶世界模型全景综述
这篇持续更新的综述为自动驾驶世界模型构建了一套三层分类法:Tier I 生成未来物理世界(Image/BEV/OG/PC 四类生成范式)、Tier II 智能体行为规划(规则与学习双轨)、Tier III 预测与规划交互。它系统梳理了自监督学习、多模态预训练、生成式数据增强等训练范式,并配套发布 WMAD 论文清单与基准。是当前入门自动驾驶世界模型最系统的地图。
🌐 世界模型 📚 综述 🎨 扩散模型 🚗 自动驾驶