论文精读|From Foundation to Application: Improving VLA Models in Practice(LingBot-VLA 2.0)

蚂蚁 LingBot-VLA 2.0 在数据、动作空间、预测建模三个维度同时补课:6 万小时多本体预训练数据覆盖 9 种构型,全身自由度动作空间支持头部/腰部/底盘/灵巧手协同控制,双查询蒸馏赋予模型向前看的预测能力。Token 级稀疏 MoE 动作专家有效解耦多本体异构动力学。在 GM-100 双臂基准与长程移动操作上全面领先 π0.5。

2026年7月19日 · 4 分钟 · 850 字 · 

论文精读|iPad: Iterative Proposal-centric End-to-End Autonomous Driving

iPad提出了一种以轨迹提案为中心的端到端自动驾驶框架,通过ProFormer迭代式精炼稀疏BEV提案,替代了传统的密集BEV网格范式,在NAVSIM和Bench2Drive上达到SOTA且计算效率提高10倍以上。

2026年7月29日 · 4 分钟 · 675 字 · 

论文精读|虚实对齐:具身智能的全面综述——从仿真到真实的迁移

本文从虚实对齐的视角全面综述具身智能,系统分析了具身感知、具身交互、具身智能体和仿真到真实迁移四大研究方向,深入探讨了多模态大模型在虚拟和现实具身智能体中的应用。

2026年7月28日 · 2 分钟 · 361 字 · 

论文精读|DrivoR: Driving on Registers — 基于寄存器token的高效端到端自动驾驶

DrivoR提出了一种极简的纯Transformer端到端自动驾驶架构,利用ViT寄存器token将多相机视觉特征压缩为紧凑场景表示,仅需~40M参数即可在NAVSIM和HUGSIM上达到SOTA。

2026年7月29日 · 5 分钟 · 935 字 · 

论文精读|ABot-M0.5:统一的移动操作世界动作模型

ABot-M0.5 用’三层对齐’策略重新设计了移动操作的世界动作模型:潜在动作模块在帧级粒度捕捉视觉状态转移,解决时间粒度粗糙导致的精细接触丢失。双层 Mixture-of-Transformers 解耦导航与操作的动作空间,dream-forcing 训练策略打通训练与推理的分布鸿沟。在长程任务和精细控制上同时达到 SOTA。

2026年7月19日 · 4 分钟 · 674 字 · 

论文精读|ExploreVLA:密集世界建模与探索驱动的端到端自动驾驶

VLA 模型通过行为克隆学习驾驶策略,但受限于模仿学习无法探索专家分布之外的高质量策略。ExploreVLA 提出统一的理解-生成框架:用未来 RGB + 深度图生成作为密集世界建模目标,再利用世界模型的图像预测不确定性作为内在探索奖励,通过安全门控的 GRPO 优化策略。在 NAVSIM 上达到 93.7 PDMS 和 88.8 EPDMS。

2026年7月19日 · 5 分钟 · 946 字 · 

论文精读|Agent-driven Long-tail Simulation for Autonomous Driving:用 LLM 代理驱动自动驾驶长尾仿真

本文用指令跟随 LLM 代理接管仿真器中所有交通参与者,抛弃了日志回放和规则代理的传统仿真范式。LLM 通过结构化动作接口控制每辆车的目标速度、车道与让行行为,配合 Flow-Matching 轨迹生成器实现高保真物理执行。配套的 SemanticPlan 长尾语义闭环基准暴露出 SOTA 规划器在意图性交互场景中仍频繁翻车的短板。

2026年7月19日 · 4 分钟 · 693 字 · 

论文精读|K-Risk:知识增强的高风险驾驶场景数据集

K-Risk 整合欧美中三大洲 20 个轨迹数据集,用 DRF 驱动风险筛选流水线统一抽取高风险事件。它通过 LLM 为每个事件生成三元组标注(结构化描述+异常行为通知+经闭环仿真器验证的因果风险分析),首次将高风险事件标签、语义标注和可验证决策信号三合一打包。产出 31,398 个高风险事件和 1,036 个极端近碰撞子集,为风险感知自动驾驶提供标准化评测基础。

2026年7月19日 · 4 分钟 · 738 字 · 

论文精读|Vesta:统一的具身推理通用模型

NVIDIA 的 Vesta 用单一 Qwen3-VL-8B 基础模型统一定位、空间推理、导航和长程规划四大具身智能能力,取代了传统的拼装专家路线。它通过统一的条件语言生成范式和简洁的多模态记忆挽具,让自注意力在历史帧与当前观察间建立长程依赖。平均超越各类别最优专家 20% 以上,真机任务成功率提升超 35%。

2026年7月19日 · 3 分钟 · 607 字 · 

论文精读|LingBot-VLA:务实的 VLA 基础模型

LingBot-VLA 以’务实’为核心设计哲学,用 9 种双臂构型、约 2 万小时真机数据训出一个跨平台 VLA 基础模型。它通过跨构型预训练学出与具体硬件解耦的动作策略,辅以开源高效代码库(8 卡 261 样本/秒)和 GM-100 基准。在 4 个平台 100 类任务上展现强泛化能力,将 VLA 从论文模型推向产线工具。

2026年7月19日 · 4 分钟 · 818 字 · 

CoWorld-VLA精读:多专家世界模型中的自动驾驶推理

CoWorld-VLA 在 VLM 隐空间中构建多专家 Latent CoT 推理框架,解决了文本 CoT 丢失空间信息而隐空间缺乏可条件化信号的根本矛盾。它通过语义交互、几何结构、动态演化与轨迹意图四种专家 Token,将互补的世界知识编码为显式可用的规划条件。在 NAVSIM v1 上达到 89.8 PDMS,证明了结构化隐式推理的有效性。

2026年7月19日 · 3 分钟 · 559 字 · 

RT-2精读:VLA奠基之作——将网络知识迁移到机器人控制

RT-2 由 Google DeepMind 提出,首次将互联网预训练的 VLM 通过动作编码为文本 Token 的方式转化为 VLA 模型。它开创性地用机器人数据微调大规模图文模型,让网络知识迁移到具身控制,使机器人具备语义理解和零样本泛化能力。在 6k 次真机试验中验证了涌现的语义推理和从未见过的任务执行能力,是 VLA 范式的奠基之作。

2026年7月19日 · 2 分钟 · 320 字 · 

VLA-World精读:统一预测想象与反思推理的视觉-语言-行动世界模型

VLA-World 通过将 VLA 的推理能力与世界模型的预测想象统一在单一框架中,实现了预测-生成-反思-规划的完整闭环。它利用动作驱动的可行轨迹引导下一帧图像生成,再对自生成的未来帧进行推理以修正轨迹,在 nuScenes 的规划和生成基准上均达到 SOTA。

2026年7月19日 · 6 分钟 · 1160 字 · 

论文精读|nuTruck:面向分布式电驱重卡的自动驾驶规划闭环基准

nuTruck 是首个面向分布式电驱重卡(DET)的规划训练与闭环评测基准,填补了学习型规划器在重卡领域被忽视的安全空白。它构建三轴六轮高保真非线性动力学模型并引入侧翻风险指标 LTR 与 NRS,证明了乘用车时代的’无碰撞即安全’假设在重卡上完全失效。核心发现:规划层必须考虑动力学安全,下游控制器无法兜底。

2026年7月19日 · 5 分钟 · 1024 字 · 

论文精读|VADv2:概率规划——把驾驶决策从"猜唯一答案"变成"算概率分布"

VADv2 把驾驶规划从’猜唯一答案’的确定性回归改造成’算所有动作的概率分布再采样’的概率规划范式。它用规划词表离散化连续动作空间、用概率场函数建模场景与动作的关联,天然处理多模态非凸解空间。在 CARLA Town05 将 Drive Score 从 76.1 拉到 85.1,且无需任何规则后处理,被 ICLR 2026 接收。

2026年7月19日 · 6 分钟 · 1206 字 · 

论文精读|WCog-VLA:双层级世界认知,让自动驾驶从被动反应走向主动博弈

WCog-VLA 是首个桥接语义层世界预测与生成层世界演化的 VLA 框架,将 VLA 从被动反应推向主动博弈。语义层用 agent token+Game-CoT(Stackelberg 博弈思维链)做世界预测与意图推理,生成层用对齐解耦扩散 Transformer 合成多智能体联合轨迹。在 NAVSIM 刷新 PDMS 92.9 的 SOTA,证明双层级世界认知是 VLA 进阶的关键方向。

2026年7月19日 · 5 分钟 · 1016 字 · 

论文精读|DriveTransformer:统一Transformer——告别BEV,拥抱稀疏Token并行交互

DriveTransformer 彻底抛弃了 BEV 表示——不再构建稠密 BEV 特征,而是让任务 query 直接与原始传感器特征交互。三种注意力(Sensor Cross-Attention、Task Self-Attention、Temporal Cross-Attention)构成统一框架,支持单阶段端到端训练。在 Bench2Drive 闭环评测中以 63.46 Driving Score 大幅超越 UniAD(45.81)和 VAD(42.35),且在鲁棒性上碾压 BEV 方案。获 ICLR 2025 接收。

2026年7月30日 · 11 分钟 · 2172 字 · 

论文精读|TransFuser:用 Transformer 做传感器融合——让相机和激光雷达"商量着开车"

TransFuser 在 CARLA 上首次验证了 Transformer 做多模态传感器融合的可行性——用自注意力让图像和 LiDAR 特征在多个分辨率上密集交互,取代简单的几何融合。在 CARLA Leaderboard 和 Longest6 基准上以显著优势领先此前所有方法,将碰撞率降低 48%。

2026年7月30日 · 8 分钟 · 1665 字 · 

论文精读|Diffusion Policy:扩散模型做机器人动作生成

Diffusion Policy 将机器人动作生成重新定义为条件去噪过程,让策略网络从噪声中逐步雕刻出动作序列。它天然支持多模态动作分布与高维动作空间,解决了传统行为克隆的 mode averaging 和复合误差问题。经 CNN 和 Transformer 双架构验证,成为后续 π0、Qwen-VLA 等 VLA 模型动作头设计的奠基之作。

2026年7月19日 · 5 分钟 · 854 字 · 

论文精读|World4Drive:用意图感知的物理隐世界模型,摆脱感知标注做端到端规划

World4Drive 是首个将多模态驾驶意图与物理隐世界模型结合的端到端框架,无需 3D 框/高精地图等昂贵感知标注。它借 Grounded-SAM 的语义先验和 Metric3D 的深度先验构建’懂物理’的隐空间,让模型在多种驾驶意图下想象未来、用世界模型打分选最优轨迹。L2 误差降 18.1%、碰撞率降 46.7%、收敛快 3.75 倍,被 ICCV 2025 收录。

2026年7月19日 · 5 分钟 · 951 字 ·