📄 论文信息

Open X-Embodiment数据集概览

  • 标题Open X-Embodiment: Robotic Learning Datasets and RT-X Models(Open X-Embodiment:跨机器人大规模数据集与RT-X模型)
  • 团队:Open X-Embodiment Collaboration(Google DeepMind、Stanford、UC Berkeley、CMU等21家机构)
  • 发表:ICRA 2024 / arXiv 2023.10
  • 关键词:跨机器人学习、大规模数据集、Transformer策略、正迁移、具身智能
  • 一句话总结:首次构建跨22种机器人的统一数据集,证明大规模异构数据训练可实现跨机器人正迁移
  • 论文链接arXiv:2310.08864
  • 代码链接robotics-transformer-x.github.io

🤔 要解决什么问题?

机器人学习的"数据孤岛"困境

在NLP和计算机视觉领域,大模型的成功已经证明了一个核心规律:大规模、多样化的数据 + 高容量模型 = 强大的泛化能力。从GPT系列到CLIP,从ImageNet到LAION,数据规模和多样性一直是推动AI能力边界的关键因素。

然而,机器人学习领域却长期面临一个尴尬的现实:

  1. 数据碎片化严重:每个实验室、每个机器人、每个任务都在独立收集数据,形成了大量"数据孤岛"
  2. 数据规模有限:即使最大的机器人数据集,其规模也远不及视觉(5-18M图像)和NLP(1.5B-4.5B文本)领域的数据集
  3. 泛化能力不足:由于训练数据的局限性,现有策略通常只能在特定环境、特定物体、特定任务上工作

核心问题

论文提出的核心问题是:

能否像NLP和视觉领域那样,在机器人领域也实现"预训练大模型 → 下游任务适配"的范式?具体来说,能否训练一个"通用"的X-机器人策略,使其能够高效适应新的机器人、任务和环境?

这个问题的挑战在于:

  • 机器人异构性:不同机器人的运动学结构、控制方式、感知配置差异巨大
  • 动作空间不统一:有的机器人是7自由度手臂,有的是双臂,还有四足机器人
  • 观测空间多样:相机视角、分辨率、传感器配置各不相同

💡 核心方法

1. Open X-Embodiment数据集构建

1.1 数据汇聚与标准化

Open X-Embodiment数据集的核心创新在于将全球21家机构的60个现有机器人数据集汇聚到一个统一的数据格式中

RT-X架构

数据集的关键统计:

  • 22种机器人形态:从单臂(Franka、xArm)到双臂(Google Robot),再到四足机器人
  • 100万+轨迹:总数据量达到百万级别
  • 527种技能:涵盖抓取、放置、推、擦、组装等多种操作
  • 160,266个任务:每个任务都有对应的语言描述

1.2 统一数据格式(RLDS)

为了处理不同机器人的异构性,团队采用了**RLDS(Reinforcement Learning Datasets)**数据格式,这是一种基于tfrecord的序列化格式,具有以下特点:

  • 灵活的动作空间:支持不同维度的动作表示(6D/7D末端执行器控制、关节角度等)
  • 多模态输入:支持RGB图像、深度图、点云等多种输入
  • 高效加载:支持所有主流深度学习框架的并行数据加载

1.3 动作空间对齐

论文采用了一种粗粒度的动作对齐策略

  • 将所有数据集的动作统一转换为7维末端执行器动作:$(x, y, z, roll, pitch, yaw, gripper\_opening)$
  • 每个数据集的动作在离散化前进行归一化
  • 模型输出的动作可以根据不同的机器人进行反归一化

需要注意的是,这种对齐是粗粒度的:

  • 不同数据集的坐标系可能不同
  • 动作可以是绝对位置或相对位置/速度
  • 相机视角和属性仍然存在显著差异

2. RT-X模型架构

论文基于两种已有的Transformer策略进行实验:

2.1 RT-1-X(基于RT-1)

  • 参数量:35M
  • 输入:15帧图像历史 + 语言指令
  • 架构:EfficientNet(视觉编码)+ FiLM层(视觉-语言融合)+ Transformer(动作预测)
  • 输出:256个离散桶中的8维动作token

2.2 RT-2-X(基于RT-2)

  • 参数量:5B或55B
  • 输入:图像 + 语言指令
  • 架构:预训练VLM(ViT + UL2)+ 动作token化
  • 输出:将动作表示为文本token(如"1 128 91 241 5 101 127")

RT-2-X的关键创新在于将动作视为另一种语言,从而可以直接利用大规模VLM的预训练知识。

3. 训练策略

  • RT-1-X:仅在机器人数据混合集上训练
  • RT-2-X:采用**联合微调(Co-fine-tuning)**策略,约1:1的比例混合VLM原始数据和机器人数据

🧪 实验验证

实验设计

论文进行了总计3600次评估试验,覆盖6种不同的机器人,回答三个核心问题:

  1. 跨机器人训练能否实现正迁移?
  2. 跨机器人训练能否提升泛化能力?
  3. 不同设计选择(模型大小、架构、数据组成)如何影响性能?

实验结果

1. 分布内性能(In-distribution)

成功率对比

小数据集场景(Kitchen Manipulation、Cable Routing、NYU Door Opening等):

  • RT-1-X在5个数据集中的4个上超越了原始方法
  • 平均成功率提升显著,证明小数据集场景从跨机器人训练中获益最大

大数据集场景(Bridge、RT-1 Paper Data):

模型BridgeRT-1 Paper
Original Method13%-
RT-140%92%
RT-1-X27%73%
RT-2-X (55B)50%91%
  • RT-1-X在大数据集上出现欠拟合,性能不如单独训练的RT-1
  • 但RT-2-X(55B)凭借更大的模型容量,能够有效利用大规模异构数据

2. 分布外泛化(Out-of-distribution)

跨机器人迁移评估

涌现技能评估(在Google Robot上评估Bridge数据集中的技能):

模型涌现技能泛化评估
RT-2 (55B)27.3%62%
RT-2-X (55B)75.8%61%

关键发现:

  • RT-2-X在涌现技能上提升约3倍(27.3% → 75.8%)
  • 这些技能在Google Robot的原始数据集中不存在,而是从WidowX机器人的数据中迁移而来
  • 移除Bridge数据集后,性能显著下降,证实了跨机器人迁移的有效性

3. 消融实验

配置模型大小历史长度Web预训练涌现技能泛化评估
RT-2-X55B75.8%61%
RT-2-X5B2帧44.4%52%
RT-2-X5B14.5%30%
RT-2-X5B2帧0%1%

关键结论:

  • 模型容量:55B模型显著优于5B模型,证明大容量是吸收异构数据的关键
  • 图像历史:包含短期图像历史显著提升泛化性能
  • Web预训练:对大模型至关重要,没有预训练几乎无法工作

🔍 个人思考

亮点

  1. 开创性的工作:首次在机器人领域实现了类似NLP/CV的"大规模预训练"范式,为具身智能指明了方向

  2. 工程与科学的完美结合

    • 工程层面:统一数据格式、跨机构协作、标准化评估
    • 科学层面:证明正迁移的可行性、分析迁移的条件
  3. 开源生态建设

    • 完整的数据集和预训练模型
    • 标准化的评估流程
    • 为社区提供了可复用的基础设施
  4. 实验设计严谨

    • 3600次评估试验,覆盖多种场景
    • 充分的消融实验,揭示关键因素
    • 小数据集和大数据集场景的对比分析

局限性

  1. 动作空间对齐仍然粗糙

    • 不同数据集的坐标系未统一
    • 绝对/相对动作混用
    • 可能限制了迁移的效果
  2. 感知模态受限

    • 主要依赖RGB视觉
    • 缺少力觉、触觉等模态
    • 限制了接触丰富任务的学习
  3. 任务复杂度有限

    • 主要集中在桌面操作任务
    • 缺少移动操作、全身控制等场景
    • 与真实世界需求仍有差距
  4. 评估场景有限

    • 主要在实验室环境评估
    • 缺少真实家庭、工业场景的验证
    • 泛化能力的验证不够充分

未来方向

  1. 更精细的动作对齐

    • 统一坐标系定义
    • 引入相对/绝对动作的显式建模
    • 探索动作表示学习
  2. 多模态融合

    • 融合力觉、触觉、音频等模态
    • 探索模态间的互补性
    • 适应接触丰富任务的需求
  3. 更大规模的数据扩展

    • 吸纳更多机构和机器人的数据
    • 增加任务和场景的多样性
    • 探索数据质量与数量的平衡
  4. 与基础模型的深度融合

    • 探索与LLM、VLM的更紧密集成
    • 利用互联网规模的预训练知识
    • 实现语言驱动的通用机器人智能

📖 延伸阅读

  1. RT-1: Brohan et al., “RT-1: Robotics Transformer for Real-World Control at Scale”, RSS 2023
  2. RT-2: Brohan et al., “RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control”, CoRL 2023
  3. RLDS: Padalkar et al., “Open X-Embodiment: Robotic Learning Datasets and RT-X Models”, 2023
  4. DROID: Khazatsky et al., “DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset”, 2024
  5. RH20T: Fang et al., “RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot”, 2023

本文为论文精读系列第1篇,聚焦具身智能领域的跨机器人学习数据集与模型。