论文精读|π0:基于Flow Matching的通用视觉-语言-动作模型
π0 用预训练 VLM 做大脑、Flow Matching 做动作头,开创了 VLA 模型动作头设计的第三条路线。Flow Matching 相比扩散采样步数更少、训练更简单,相比离散化精度更高,巧妙弥合了 VLM 与连续机器人控制之间的表征鸿沟。在迄今最大规模机器人数据集上训练,一个模型搞定从叠衣服到收桌子的多种高难度操作。
π0 用预训练 VLM 做大脑、Flow Matching 做动作头,开创了 VLA 模型动作头设计的第三条路线。Flow Matching 相比扩散采样步数更少、训练更简单,相比离散化精度更高,巧妙弥合了 VLM 与连续机器人控制之间的表征鸿沟。在迄今最大规模机器人数据集上训练,一个模型搞定从叠衣服到收桌子的多种高难度操作。
RT-1是Google Robotics团队提出的一种基于Transformer的机器人策略模型,通过在超过13万条真实机器人轨迹数据上训练,实现了对700+种任务的强大泛化能力。该工作首次证明了大规模、多样化的真实数据结合高容量架构能够在机器人领域取得类似NLP和CV领域的scalable性能。
SayCan是Google提出的将大型语言模型与机器人技能结合的方法,通过将LLM的语言知识与机器人技能的可行性(affordance)结合,实现了自然语言指令到长horizon机器人任务的规划与执行。该工作首次展示了LLM如何在真实机器人上落地,开启了LLM+机器人的新范式。
Open X-Embodiment是Google联合21家机构打造的跨机器人大规模数据集,包含22种机器人、100万+轨迹数据。基于该数据集训练的RT-X模型首次证明了跨机器人正迁移的可行性,RT-1-X成功率提升50%,RT-2-X泛化能力提升3倍。