论文精读|Sparse4D:全稀疏多摄像头 3D 感知的三连击

Sparse4D 用全稀疏范式挑战 BEV 感知路线:用稀疏实例 query 直接从多相机图像抠出 3D 目标,绕开计算昂贵的稠密 BEV 特征图。它通过稀疏 4D 关键点采样、循环时序融合和实例去噪三项核心设计,将多摄像头 3D 检测与跟踪做到 nuScenes 顶尖。作为全稀疏感知范式奠基作,后续 SparseDrive 系列在此基础上构建端到端驾驶系统。

2026年7月19日 · 4 分钟 · 844 字 · 

论文精读|Octo:开源通用机器人策略——大规模多任务机器人基础模型

Octo 是 UC Berkeley 等团队推出的开源通用机器人策略(GRP),基于 Transformer 架构在 80 万条多机器人轨迹上预训练,支持语言指令和目标图像双模式输入,可通过高效微调适配新机器人平台和动作空间。作为首个完全开源的通用机器人操控策略,Octo 为机器人基础模型的研究奠定了重要基础。

2026年7月28日 · 2 分钟 · 355 字 · 

论文精读|Last-VLA:小米的视觉-语言-动作模型

LaST-VLA 把 VLA 推理从文字 CoT 搬进连续隐空间,用 3D 几何先验(VGGT)和世界模型动力学先验(Cosmos)两个外部基础模型当特征级老师,蒸馏监督隐 CoT。它让隐式推理既绕开了文字 CoT 的慢速与幻觉问题,又避免了朴素隐 CoT 的物理脱节。在 NAVSIM 双榜单上用单目前视传感器取得 SOTA,推理时两个老师全部旁路、零额外开销。

2026年7月19日 · 4 分钟 · 665 字 · 

论文精读|OpenVLA:开源视觉-语言-动作模型——VLA走向开放生态

OpenVLA 是首个完全开源的 7B 参数视觉-语言-动作模型,在 97 万条真实机器人演示上训练,以 7 倍更少的参数超越闭源模型 RT-2-X(55B)。通过融合 DINOv2 和 SigLIP 双视觉编码器与 Llama 2 语言骨干,结合 LoRA 微调和量化推理,OpenVLA 让 VLA 模型首次走向开放生态。

2026年7月28日 · 3 分钟 · 432 字 · 

论文精读|One-VL:小米统一视觉语言模型

小米 OneVL 用双模态隐式推理超越显式 CoT,攻克了隐式推理长期打不过显式 CoT 的困境。它将 55 个紧致隐 token(35 视觉+20 语言)作为信息瓶颈,用语言解码器还原语义 CoT、视觉世界模型解码器预测未来帧,双管齐下将隐空间钉死在因果关系上。推理时所有隐 token 一步 prefill,延迟与直接出答案持平,4B 模型在四大基准全 SOTA。

2026年7月19日 · 3 分钟 · 590 字 · 

论文精读|DreamerV3:通过世界模型掌握多样领域——通用强化学习智能体

DreamerV3 是 DeepMind 提出的通用强化学习算法,通过学习世界模型并在想象中规划,以单一固定超参数配置在 150 多个多样化任务上超越专用算法。首次从零开始在 Minecraft 中收集钻石,标志着强化学习向通用化迈出了重要一步。

2026年7月28日 · 3 分钟 · 452 字 · 

论文精读|Senna:用 VLM 给端到端驾驶装上'大脑'

Senna 将大型视觉语言模型(Senna-VLM)与端到端规划器(Senna-E2E)解耦协同,VLM 用自然语言输出高层决策,E2E 在该决策条件下生成精确轨迹。它巧妙绕开了 LVLM 不擅长数值预测的软肋,让 VLM 干’说人话做决策’、E2E 干’算轨迹画路点’。这条 VLM 辅助端到端驾驶的路线成为后续多个工作的设计原型。

2026年7月19日 · 3 分钟 · 457 字 · 

论文精读|UniSim:学习交互式真实世界模拟器——生成式世界模型

UniSim 是由 Google DeepMind、UC Berkeley 和 MIT 联合提出的通用真实世界模拟器,通过生成式建模将互联网图像、机器人操作、人类活动等异构数据统一到一个动作输入-视频输出的框架中。该模型能够模拟从高层语言指令到低层机器人控制的各种交互,在视觉-语言规划、强化学习和视频描述等任务上实现了零样本真实世界迁移。

2026年7月28日 · 3 分钟 · 452 字 · 

论文精读|Gen-Drive:扩散模型生成 + 强化学习精调的驾驶策略

Gen-Drive 把自动驾驶规划从’预测-规划’重构为’生成-评估’范式:行为扩散模型生成多样未来场景,学习型场景评估器(VLM 辅助训练)打分,再用 RL 微调扩散策略向高分方向优化。它创造性地将 RLHF 奖励建模思路搬进驾驶领域,验证了学习型 reward 优于人工设计。在闭环评测中展现了生成式+强化学习融合的潜力。

2026年7月19日 · 3 分钟 · 450 字 · 

论文精读|EmbodiedGPT:基于具身思维链的视觉-语言预训练

EmbodiedGPT 是由中国科学院上海AI实验室、香港大学等机构提出的端到端多模态具身基础模型,通过创新的’具身思维链’(Embodied Chain of Thought)范式,将视觉-语言预训练与具身规划紧密结合。该模型构建了大规模EgoCOT数据集,实现了从高层规划到低层控制的闭环系统,在具身规划、控制、视频描述和视觉问答等多个任务上取得了优异性能。

2026年7月28日 · 3 分钟 · 619 字 · 

论文精读|BEVFormer:时空 Transformer 玩转多摄像头 BEV 感知

BEVFormer 开创了基于可学习 BEV queries 的时空 Transformer 感知范式,用空间交叉注意力从多视图图像采样特征、用时间自注意力沿时序聚合信息。它纯靠多摄像头就在 nuScenes 上达到 56.9% NDS 逼近 LiDAR 基线。此后几乎所有端到端驾驶方案都沿用其 BEV query+时序融合的基本设计。

2026年7月19日 · 3 分钟 · 498 字 · 

论文精读|VIMA:基于多模态提示的通用机器人操作——多模态大模型驱动机器人

VIMA提出了一种统一的多模态提示接口,将多样化的机器人操作任务转化为序列建模问题。通过Transformer编码器-解码器架构和物体中心表示,VIMA在零样本泛化设置下任务成功率最高提升2.9倍。

2026年7月28日 · 1 分钟 · 205 字 · 

论文精读|DriveDreamer:构建真实驾驶场景的世界模型

DriveDreamer 是首个完全从真实驾驶数据构建的自动驾驶世界模型。它用扩散模型配合 ControlNet 机制处理 HDMap、3D 框、文本和动作等多模态结构化条件,通过两阶段训练同时实现可控驾驶视频生成与未来动作预测。作为驾驶世界模型的奠基之作,它开创了从真实场景理解到未来预测的统一范式。

2026年7月19日 · 2 分钟 · 329 字 · 

论文精读|MOO:基于预训练视觉-语言模型的开放世界物体操作

MOO利用预训练视觉-语言模型将自然语言指令与视觉物体定位相结合,实现了对从未见过的物体类别的零样本操作泛化,在真实机器人上达到约79%的成功率。

2026年7月28日 · 1 分钟 · 151 字 · 

论文精读|A Survey of World Models for Autonomous Driving:自动驾驶世界模型全景综述

这篇持续更新的综述为自动驾驶世界模型构建了一套三层分类法:Tier I 生成未来物理世界(Image/BEV/OG/PC 四类生成范式)、Tier II 智能体行为规划(规则与学习双轨)、Tier III 预测与规划交互。它系统梳理了自监督学习、多模态预训练、生成式数据增强等训练范式,并配套发布 WMAD 论文清单与基准。是当前入门自动驾驶世界模型最系统的地图。

2026年7月19日 · 3 分钟 · 595 字 · 

论文精读|LeRobot:让机器人学习触手可及——HuggingFace的开源机器人学习框架

LeRobot是HuggingFace推出的开源机器人学习库,覆盖从底层电机控制到大规模数据集收集、存储和流式传输的完整栈,支持多种低成本机器人平台和SOTA学习算法。截至2025年9月,社区已贡献16K+数据集和数百个预训练模型,形成了去中心化的机器人数据收集生态。

2026年7月28日 · 2 分钟 · 343 字 · 

论文精读|SafeDiffuser:用控制障碍函数给扩散规划加上安全保证

SafeDiffuser 把控制论中的控制障碍函数(CBF)改造为有限时间扩散不变性,嵌入扩散去噪的每一步,为数据驱动的扩散规划器提供可证明的安全保证。它解决了扩散概率采样可能越界、约束只能’软学’、采样即赌博三大安全隐患。在迷宫、足式机器人、机械臂操作上验证了安全性与生成质量的兼得。

2026年7月19日 · 4 分钟 · 662 字 · 

论文精读|具身智能VLA模型综述:从视觉-语言到动作生成的技术全景

首篇系统性综述视觉-语言-动作(VLA)模型的文章,从组件、控制策略和任务规划三个维度全面梳理了VLA模型的技术脉络,涵盖CLIP/R3M/DINOv2等视觉表征、RT-1/RT-2/OpenVLA等控制策略、SayCan/Code as Policies等任务规划方法,并深入探讨了安全、数据集、基础模型等挑战与未来方向。

2026年7月28日 · 3 分钟 · 480 字 · 

论文精读|MVAdapt:零样本多车型适应的端到端自动驾驶

MVAdapt 揭示了端到端自动驾驶的’车辆域差距’:模型隐式绑定了训练车的动力学特性,换车即翻车。它用轻量物理编码器编码轴距、质量、驱动方式等物理属性,通过交叉注意力注入冻结的场景编码器,在不损失视觉泛化能力的前提下实现跨车型适应。在 58 种车型上的零样本迁移表现大幅领先 naive transfer 和 URMA 等基线。

2026年7月19日 · 2 分钟 · 413 字 · 

论文精读|Teaching VLA Models What to See and Where to Look:DriveTeach-VLA 的视觉教学三段式

DriveTeach-VLA 指出驾驶 VLA 的瓶颈不在语言推理而在视觉空间 grounding,核心问题不是’想不清’而是’看不对’。它提出三段式视觉教学管线——DVD 蒸馏教模型’看什么’、2D 轨迹引导提示教’往哪看’、TGP-guided GRPO 教’怎么动’——层层递进注入驾驶感知先验。在 Qwen2.5-VL 上刷新 NAVSIM 与 nuScenes 双榜单 SOTA。

2026年7月19日 · 4 分钟 · 818 字 ·