论文精读|具身智能:形态、动作、感知与学习的协同——全面综述
本文从形态、动作、感知与学习四个维度的协同关系出发,系统综述了具身智能的研究进展,强调智能是大脑、身体与环境紧密耦合的产物,并提出了统一的具身智能框架。
本文从形态、动作、感知与学习四个维度的协同关系出发,系统综述了具身智能的研究进展,强调智能是大脑、身体与环境紧密耦合的产物,并提出了统一的具身智能框架。
蚂蚁 LingBot-VLA 2.0 在数据、动作空间、预测建模三个维度同时补课:6 万小时多本体预训练数据覆盖 9 种构型,全身自由度动作空间支持头部/腰部/底盘/灵巧手协同控制,双查询蒸馏赋予模型向前看的预测能力。Token 级稀疏 MoE 动作专家有效解耦多本体异构动力学。在 GM-100 双臂基准与长程移动操作上全面领先 π0.5。
iPad提出了一种以轨迹提案为中心的端到端自动驾驶框架,通过ProFormer迭代式精炼稀疏BEV提案,替代了传统的密集BEV网格范式,在NAVSIM和Bench2Drive上达到SOTA且计算效率提高10倍以上。
本文从虚实对齐的视角全面综述具身智能,系统分析了具身感知、具身交互、具身智能体和仿真到真实迁移四大研究方向,深入探讨了多模态大模型在虚拟和现实具身智能体中的应用。
DrivoR提出了一种极简的纯Transformer端到端自动驾驶架构,利用ViT寄存器token将多相机视觉特征压缩为紧凑场景表示,仅需~40M参数即可在NAVSIM和HUGSIM上达到SOTA。
ABot-M0.5 用’三层对齐’策略重新设计了移动操作的世界动作模型:潜在动作模块在帧级粒度捕捉视觉状态转移,解决时间粒度粗糙导致的精细接触丢失。双层 Mixture-of-Transformers 解耦导航与操作的动作空间,dream-forcing 训练策略打通训练与推理的分布鸿沟。在长程任务和精细控制上同时达到 SOTA。
VLA 模型通过行为克隆学习驾驶策略,但受限于模仿学习无法探索专家分布之外的高质量策略。ExploreVLA 提出统一的理解-生成框架:用未来 RGB + 深度图生成作为密集世界建模目标,再利用世界模型的图像预测不确定性作为内在探索奖励,通过安全门控的 GRPO 优化策略。在 NAVSIM 上达到 93.7 PDMS 和 88.8 EPDMS。
本文用指令跟随 LLM 代理接管仿真器中所有交通参与者,抛弃了日志回放和规则代理的传统仿真范式。LLM 通过结构化动作接口控制每辆车的目标速度、车道与让行行为,配合 Flow-Matching 轨迹生成器实现高保真物理执行。配套的 SemanticPlan 长尾语义闭环基准暴露出 SOTA 规划器在意图性交互场景中仍频繁翻车的短板。
K-Risk 整合欧美中三大洲 20 个轨迹数据集,用 DRF 驱动风险筛选流水线统一抽取高风险事件。它通过 LLM 为每个事件生成三元组标注(结构化描述+异常行为通知+经闭环仿真器验证的因果风险分析),首次将高风险事件标签、语义标注和可验证决策信号三合一打包。产出 31,398 个高风险事件和 1,036 个极端近碰撞子集,为风险感知自动驾驶提供标准化评测基础。
NVIDIA 的 Vesta 用单一 Qwen3-VL-8B 基础模型统一定位、空间推理、导航和长程规划四大具身智能能力,取代了传统的拼装专家路线。它通过统一的条件语言生成范式和简洁的多模态记忆挽具,让自注意力在历史帧与当前观察间建立长程依赖。平均超越各类别最优专家 20% 以上,真机任务成功率提升超 35%。
LingBot-VLA 以’务实’为核心设计哲学,用 9 种双臂构型、约 2 万小时真机数据训出一个跨平台 VLA 基础模型。它通过跨构型预训练学出与具体硬件解耦的动作策略,辅以开源高效代码库(8 卡 261 样本/秒)和 GM-100 基准。在 4 个平台 100 类任务上展现强泛化能力,将 VLA 从论文模型推向产线工具。
CoWorld-VLA 在 VLM 隐空间中构建多专家 Latent CoT 推理框架,解决了文本 CoT 丢失空间信息而隐空间缺乏可条件化信号的根本矛盾。它通过语义交互、几何结构、动态演化与轨迹意图四种专家 Token,将互补的世界知识编码为显式可用的规划条件。在 NAVSIM v1 上达到 89.8 PDMS,证明了结构化隐式推理的有效性。
RT-2 由 Google DeepMind 提出,首次将互联网预训练的 VLM 通过动作编码为文本 Token 的方式转化为 VLA 模型。它开创性地用机器人数据微调大规模图文模型,让网络知识迁移到具身控制,使机器人具备语义理解和零样本泛化能力。在 6k 次真机试验中验证了涌现的语义推理和从未见过的任务执行能力,是 VLA 范式的奠基之作。
VLA-World 通过将 VLA 的推理能力与世界模型的预测想象统一在单一框架中,实现了预测-生成-反思-规划的完整闭环。它利用动作驱动的可行轨迹引导下一帧图像生成,再对自生成的未来帧进行推理以修正轨迹,在 nuScenes 的规划和生成基准上均达到 SOTA。
nuTruck 是首个面向分布式电驱重卡(DET)的规划训练与闭环评测基准,填补了学习型规划器在重卡领域被忽视的安全空白。它构建三轴六轮高保真非线性动力学模型并引入侧翻风险指标 LTR 与 NRS,证明了乘用车时代的’无碰撞即安全’假设在重卡上完全失效。核心发现:规划层必须考虑动力学安全,下游控制器无法兜底。
VADv2 把驾驶规划从’猜唯一答案’的确定性回归改造成’算所有动作的概率分布再采样’的概率规划范式。它用规划词表离散化连续动作空间、用概率场函数建模场景与动作的关联,天然处理多模态非凸解空间。在 CARLA Town05 将 Drive Score 从 76.1 拉到 85.1,且无需任何规则后处理,被 ICLR 2026 接收。
WCog-VLA 是首个桥接语义层世界预测与生成层世界演化的 VLA 框架,将 VLA 从被动反应推向主动博弈。语义层用 agent token+Game-CoT(Stackelberg 博弈思维链)做世界预测与意图推理,生成层用对齐解耦扩散 Transformer 合成多智能体联合轨迹。在 NAVSIM 刷新 PDMS 92.9 的 SOTA,证明双层级世界认知是 VLA 进阶的关键方向。
DriveTransformer 彻底抛弃了 BEV 表示——不再构建稠密 BEV 特征,而是让任务 query 直接与原始传感器特征交互。三种注意力(Sensor Cross-Attention、Task Self-Attention、Temporal Cross-Attention)构成统一框架,支持单阶段端到端训练。在 Bench2Drive 闭环评测中以 63.46 Driving Score 大幅超越 UniAD(45.81)和 VAD(42.35),且在鲁棒性上碾压 BEV 方案。获 ICLR 2025 接收。
TransFuser 在 CARLA 上首次验证了 Transformer 做多模态传感器融合的可行性——用自注意力让图像和 LiDAR 特征在多个分辨率上密集交互,取代简单的几何融合。在 CARLA Leaderboard 和 Longest6 基准上以显著优势领先此前所有方法,将碰撞率降低 48%。
Diffusion Policy 将机器人动作生成重新定义为条件去噪过程,让策略网络从噪声中逐步雕刻出动作序列。它天然支持多模态动作分布与高维动作空间,解决了传统行为克隆的 mode averaging 和复合误差问题。经 CNN 和 Transformer 双架构验证,成为后续 π0、Qwen-VLA 等 VLA 模型动作头设计的奠基之作。