论文精读|PaLM-E:具身多模态语言模型——让机器人理解真实世界
PaLM-E是Google与柏林工业大学联合提出的具身多模态语言模型,将PaLM大语言模型与视觉编码器结合,直接处理机器人传感器数据。该模型在562B参数规模下不仅在机器人任务上表现出色,还在OK-VQA等视觉语言基准上达到SOTA,同时保留了强大的语言能力。
PaLM-E是Google与柏林工业大学联合提出的具身多模态语言模型,将PaLM大语言模型与视觉编码器结合,直接处理机器人传感器数据。该模型在562B参数规模下不仅在机器人任务上表现出色,还在OK-VQA等视觉语言基准上达到SOTA,同时保留了强大的语言能力。
SayCan是Google提出的将大型语言模型与机器人技能结合的方法,通过将LLM的语言知识与机器人技能的可行性(affordance)结合,实现了自然语言指令到长horizon机器人任务的规划与执行。该工作首次展示了LLM如何在真实机器人上落地,开启了LLM+机器人的新范式。
Open X-Embodiment是Google联合21家机构打造的跨机器人大规模数据集,包含22种机器人、100万+轨迹数据。基于该数据集训练的RT-X模型首次证明了跨机器人正迁移的可行性,RT-1-X成功率提升50%,RT-2-X泛化能力提升3倍。
DROID是Google联合18家机构打造的大规模真实世界机器人操作数据集,包含76k演示轨迹、564个场景、86个任务,跨越北美、亚洲、欧洲三大洲。实验证明使用DROID训练的策略在性能和泛化能力上平均提升20%。
UniSim 是由 Google DeepMind、UC Berkeley 和 MIT 联合提出的通用真实世界模拟器,通过生成式建模将互联网图像、机器人操作、人类活动等异构数据统一到一个动作输入-视频输出的框架中。该模型能够模拟从高层语言指令到低层机器人控制的各种交互,在视觉-语言规划、强化学习和视频描述等任务上实现了零样本真实世界迁移。
RT-2 由 Google DeepMind 提出,首次将互联网预训练的 VLM 通过动作编码为文本 Token 的方式转化为 VLA 模型。它开创性地用机器人数据微调大规模图文模型,让网络知识迁移到具身控制,使机器人具备语义理解和零样本泛化能力。在 6k 次真机试验中验证了涌现的语义推理和从未见过的任务执行能力,是 VLA 范式的奠基之作。