RT-2精读:VLA奠基之作——将网络知识迁移到机器人控制
RT-2 由 Google DeepMind 提出,首次将互联网预训练的 VLM 通过动作编码为文本 Token 的方式转化为 VLA 模型。它开创性地用机器人数据微调大规模图文模型,让网络知识迁移到具身控制,使机器人具备语义理解和零样本泛化能力。在 6k 次真机试验中验证了涌现的语义推理和从未见过的任务执行能力,是 VLA 范式的奠基之作。
RT-2 由 Google DeepMind 提出,首次将互联网预训练的 VLM 通过动作编码为文本 Token 的方式转化为 VLA 模型。它开创性地用机器人数据微调大规模图文模型,让网络知识迁移到具身控制,使机器人具备语义理解和零样本泛化能力。在 6k 次真机试验中验证了涌现的语义推理和从未见过的任务执行能力,是 VLA 范式的奠基之作。
Diffusion Policy 将机器人动作生成重新定义为条件去噪过程,让策略网络从噪声中逐步雕刻出动作序列。它天然支持多模态动作分布与高维动作空间,解决了传统行为克隆的 mode averaging 和复合误差问题。经 CNN 和 Transformer 双架构验证,成为后续 π0、Qwen-VLA 等 VLA 模型动作头设计的奠基之作。
ACT+ALOHA 用不到 2 万美元的开源双臂遥操作平台解决了精细双臂操控的数据获取难题。ACT 采用动作分块(Action Chunking)+CVAE Transformer 的抗复合误差策略,将模仿学习精度推至新高度。ALOHA 的低成本同构主从机械臂设计为具身智能数据采集建立了新范式。