技术博客
自动驾驶 VLA · 世界模型 · 端到端 · 前沿论文精读与知识分享
📅 2026
JUL
28
论文精读|虚实对齐:具身智能的全面综述——从仿真到真实的迁移
本文从虚实对齐的视角全面综述具身智能,系统分析了具身感知、具身交互、具身智能体和仿真到真实迁移四大研究方向,深入探讨了多模态大模型在虚拟和现实具身智能体中的应用。
JUL
28
论文精读|具身智能:形态、动作、感知与学习的协同——全面综述
本文从形态、动作、感知与学习四个维度的协同关系出发,系统综述了具身智能的研究进展,强调智能是大脑、身体与环境紧密耦合的产物,并提出了统一的具身智能框架。
JUL
28
论文精读|具身智能VLA模型综述:从视觉-语言到动作生成的技术全景
首篇系统性综述视觉-语言-动作(VLA)模型的文章,从组件、控制策略和任务规划三个维度全面梳理了VLA模型的技术脉络,涵盖CLIP/R3M/DINOv2等视觉表征、RT-1/RT-2/OpenVLA等控制策略、SayCan/Code as Policies等任务规划方法,并深入探讨了安全、数据集、基础模型等挑战与未来方向。
JUL
28
论文精读|LeRobot:让机器人学习触手可及——HuggingFace的开源机器人学习框架
LeRobot是HuggingFace推出的开源机器人学习库,覆盖从底层电机控制到大规模数据集收集、存储和流式传输的完整栈,支持多种低成本机器人平台和SOTA学习算法。截至2025年9月,社区已贡献16K+数据集和数百个预训练模型,形成了去中心化的机器人数据收集生态。
JUL
28
论文精读|MOO:基于预训练视觉-语言模型的开放世界物体操作
MOO利用预训练视觉-语言模型将自然语言指令与视觉物体定位相结合,实现了对从未见过的物体类别的零样本操作泛化,在真实机器人上达到约79%的成功率。
JUL
28
论文精读|VIMA:基于多模态提示的通用机器人操作——多模态大模型驱动机器人
VIMA提出了一种统一的多模态提示接口,将多样化的机器人操作任务转化为序列建模问题。通过Transformer编码器-解码器架构和物体中心表示,VIMA在零样本泛化设置下任务成功率最高提升2.9倍。
JUL
28
论文精读|EmbodiedGPT:基于具身思维链的视觉-语言预训练
EmbodiedGPT 是由中国科学院上海AI实验室、香港大学等机构提出的端到端多模态具身基础模型,通过创新的'具身思维链'(Embodied Chain of Thought)范式,将视觉-语言预训练与具身规划紧密结合。该模型构建了大规模EgoCOT数据集,实现了从高层规划到低层控制的闭环系统,在具身规划、控制、视频描述和视觉问答等多个任务上取得了优异性能。
JUL
28
论文精读|UniSim:学习交互式真实世界模拟器——生成式世界模型
UniSim 是由 Google DeepMind、UC Berkeley 和 MIT 联合提出的通用真实世界模拟器,通过生成式建模将互联网图像、机器人操作、人类活动等异构数据统一到一个动作输入-视频输出的框架中。该模型能够模拟从高层语言指令到低层机器人控制的各种交互,在视觉-语言规划、强化学习和视频描述等任务上实现了零样本真实世界迁移。
JUL
28
论文精读|DreamerV3:通过世界模型掌握多样领域——通用强化学习智能体
DreamerV3 是 DeepMind 提出的通用强化学习算法,通过学习世界模型并在想象中规划,以单一固定超参数配置在 150 多个多样化任务上超越专用算法。首次从零开始在 Minecraft 中收集钻石,标志着强化学习向通用化迈出了重要一步。
JUL
28
论文精读|OpenVLA:开源视觉-语言-动作模型——VLA走向开放生态
OpenVLA 是首个完全开源的 7B 参数视觉-语言-动作模型,在 97 万条真实机器人演示上训练,以 7 倍更少的参数超越闭源模型 RT-2-X(55B)。通过融合 DINOv2 和 SigLIP 双视觉编码器与 Llama 2 语言骨干,结合 LoRA 微调和量化推理,OpenVLA 让 VLA 模型首次走向开放生态。
JUL
28
论文精读|Octo:开源通用机器人策略——大规模多任务机器人基础模型
Octo 是 UC Berkeley 等团队推出的开源通用机器人策略(GRP),基于 Transformer 架构在 80 万条多机器人轨迹上预训练,支持语言指令和目标图像双模式输入,可通过高效微调适配新机器人平台和动作空间。作为首个完全开源的通用机器人操控策略,Octo 为机器人基础模型的研究奠定了重要基础。
JUL
28
论文精读|RH20T:面向拟人全身控制的机器人操作数据集
RH20T是上海交通大学推出的超大规模机器人操作数据集,包含110,000+条接触丰富的真实世界操作序列,覆盖147项任务、7种机器人配置。数据集提供视觉、力觉、音频等多模态信息,支持一次性模仿学习研究。
JUL
28
论文精读|DROID:大规模真实世界机器人操作数据集
DROID是Google联合18家机构打造的大规模真实世界机器人操作数据集,包含76k演示轨迹、564个场景、86个任务,跨越北美、亚洲、欧洲三大洲。实验证明使用DROID训练的策略在性能和泛化能力上平均提升20%。
JUL
28
论文精读|Open X-Embodiment:跨机器人大规模数据集与RT-X模型
Open X-Embodiment是Google联合21家机构打造的跨机器人大规模数据集,包含22种机器人、100万+轨迹数据。基于该数据集训练的RT-X模型首次证明了跨机器人正迁移的可行性,RT-1-X成功率提升50%,RT-2-X泛化能力提升3倍。
JUL
28
论文精读|Gato:DeepMind的通用智能体——一个网络玩转604种任务
Gato是DeepMind提出的通用智能体,通过在604种不同任务上联合训练,用一个Transformer网络同时处理 Atari 游戏、机器人控制、图像描述、文本对话等任务。它证明了单一模型可以掌握多种模态的技能,是迈向通用人工智能的重要一步。
JUL
28
论文精读|SayCan:让大型语言模型在机器人上落地执行
SayCan是Google提出的将大型语言模型与机器人技能结合的方法,通过将LLM的语言知识与机器人技能的可行性(affordance)结合,实现了自然语言指令到长horizon机器人任务的规划与执行。该工作首次展示了LLM如何在真实机器人上落地,开启了LLM+机器人的新范式。
JUL
28
论文精读|PaLM-E:具身多模态语言模型——让机器人理解真实世界
PaLM-E是Google与柏林工业大学联合提出的具身多模态语言模型,将PaLM大语言模型与视觉编码器结合,直接处理机器人传感器数据。该模型在562B参数规模下不仅在机器人任务上表现出色,还在OK-VQA等视觉语言基准上达到SOTA,同时保留了强大的语言能力。
JUL
28
论文精读|RT-1:Robotics Transformer——大规模真实机器人数据驱动的策略学习
RT-1是Google Robotics团队提出的一种基于Transformer的机器人策略模型,通过在超过13万条真实机器人轨迹数据上训练,实现了对700+种任务的强大泛化能力。该工作首次证明了大规模、多样化的真实数据结合高容量架构能够在机器人领域取得类似NLP和CV领域的scalable性能。
JUL
28
论文精读|LIBERO:面向终身机器人学习的知识迁移基准
LIBERO 是首个面向终身决策学习(LLDM)的机器人操作基准,包含 130 个语言条件任务和 4 个任务套件。它系统研究了五种知识迁移场景下的策略架构、终身学习算法、任务顺序、预训练效果等关键问题。一个反直觉的发现:简单的顺序微调在正向迁移上反而优于 EWC、ER 等经典终身学习方法。
JUL
27
论文精读|SparseOccVLA:稀疏占用查询桥接 Occupancy 与 VLM,实现统一 4D 场景理解与规划
SparseOccVLA 用稀疏占用查询作为视觉与语言之间的单一桥梁,彻底摆脱 ViT patch token,让 LLM 在统一框架内同时完成场景理解、占用预测和轨迹规划。在 OmniDrive-nuScenes 上 CIDEr 提升 7%,Occ3D-nuScenes mIoU 提升 0.5,nuScenes 规划指标达 SOTA。