📄 论文信息

DROID机器人平台

  • 标题DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset(DROID:大规模真实世界机器人操作数据集)
  • 团队:Stanford、UC Berkeley、Toyota Research Institute、Google DeepMind等18家机构
  • 发表:CoRL 2024 / arXiv 2024.03
  • 关键词:真实世界数据集、分布式采集、场景多样性、机器人操作、泛化能力
  • 一句话总结:首个跨越三大洲、564个真实场景的大规模机器人操作数据集,显著提升策略性能与泛化能力
  • 论文链接arXiv:2403.12945
  • 代码链接droid-dataset.github.io

🤔 要解决什么问题?

真实世界数据采集的困境

在机器人操作领域,数据多样性是训练泛化策略的关键。然而,现有的机器人数据集面临一个根本性矛盾:

  1. 实验室数据的局限性

    • 大多数数据集在受控的实验室环境中采集
    • 场景单一、光照固定、物体有限
    • 训练出的策略难以泛化到真实世界
  2. 真实世界采集的挑战

    • 将机器人部署到不同环境面临后勤和安全挑战
    • 需要大量的硬件和人力投入
    • 不同机构的硬件不一致导致数据难以整合
  3. 现有数据集的不足

数据集轨迹数场景数语言标注相机标定
RT-1130k2
RH20T13k7
Bridge V260k24
Open X-Embodiment1.4M311(✓)
DROID76k564

核心问题

论文试图解决的核心问题是:

如何构建一个既大规模又高多样性、既高质量又易于复现的机器人操作数据集,以支持训练更加鲁棒和泛化的操作策略?

具体来说,需要回答:

  • 如何在不同地点、不同机构之间实现一致的数据采集?
  • 如何确保数据的场景多样性任务多样性
  • 如何保证数据的质量和可用性(相机标定、语言标注等)?

💡 核心方法

1. DROID硬件平台设计

为了实现跨机构的一致数据采集,DROID团队设计了一个标准化的机器人平台

DROID机器人平台

硬件配置

  • 机器人:Franka Emika Panda 7DoF机械臂 + Robotiq 2F-85夹爪
  • 相机
    • 2个外部Zed 2立体相机(可调节三脚架安装)
    • 1个腕部Zed Mini立体相机
  • 控制器:Meta Quest 2 VR头显 + 手柄(6D位姿控制)
  • 计算:Franka控制盒 + NUC(Polymetis服务器)+ Alienware笔记本(数据采集GUI)
  • 移动性:安装在带轮子的可调节高度桌面上

设计原则

  • 可移植性:整个平台可通过单根电源线供电,便于在不同场景间移动
  • 可复现性:所有13个机构使用完全相同的硬件配置
  • 灵活性:相机视角可快速调整以适应新场景

2. 分布式数据采集协议

DROID的核心创新在于其分布式数据采集协议

动词和物体分布

采集流程

  1. 将机器人移动到新场景
  2. 调整第三人称相机视角
  3. 使用棋盘格进行外参标定
  4. 在GUI中输入当前场景的潜在任务列表
  5. 系统随机采样任务提示采集者
  6. 定期执行场景增强(移动底座、调整相机、改变光照、增减物体)
  7. 每个场景采集约100条轨迹或20分钟数据后转移到新场景

质量控制

  • 采集者标记每条轨迹是否成功
  • 76k条成功轨迹(另有16k条失败轨迹也包含在数据集中)
  • 通过tasq.ai平台进行众包语言标注,每条轨迹最多3条独立标注

3. 相机自动标定

由于手动标定在大规模采集中的局限性,DROID开发了自动后处理标定流程

  • 相机-基座标定:约36k个唯一场景的单相机标定
  • 相机-相机标定:所有场景的双相机标定
  • 精选子集:24k个场景的完整三相机标定

这显著提高了数据集在3D感知和几何理解任务中的可用性。


🧪 实验验证

实验设计

论文在6个任务、4个地点(实验室、办公室、真实家庭)进行了广泛的评估:

策略性能

评估任务

  1. 关闭华夫饼机:短视域任务,随机化位置(70条演示)
  2. 将薯片放到盘子上:拾取放置任务,新物体+干扰物
  3. 将苹果放入锅中:多阶段任务(拾取→放置→关盖)
  4. 烤面包:多阶段任务,新物体
  5. 清理桌面:打开抽屉→放入橡皮→关闭
  6. 煮扁豆:复杂多阶段任务(开盖→倒扁豆→开火)

对比方法

  • 无协同训练:仅使用任务特定数据
  • Open X-Embodiment协同训练:使用OXE数据集
  • DROID协同训练:使用DROID数据集

实验结果

1. 策略性能提升

设置无协同训练OXE协同训练DROID协同训练
分布内基准+15%+22%
分布外基准+10%+17%

关键发现:

  • DROID协同训练在所有任务上都显著提升性能
  • 相比无协同训练,平均提升22%(分布内)和17%(分布外)
  • 相比OXE协同训练,DROID也有显著优势

2. 场景多样性的重要性

论文进行了专门的消融实验来验证场景多样性的影响:

  • 使用DROID的子集(仅单个场景)训练 → 性能显著下降
  • 使用完整DROID(564个场景)训练 → 最佳性能
  • 证明场景多样性是DROID成功的关键因素

3. 鲁棒性验证

在分布外评估中,DROID训练的策略表现出更强的鲁棒性:

  • 干扰物鲁棒性:在桌面增加干扰物体后仍能成功
  • 新物体泛化:对训练中未见过的物体实例也能操作
  • 场景泛化:在不同的桌面布局和光照条件下工作

🔍 个人思考

亮点

  1. 真实世界数据采集的范式创新

    • 首次实现跨三大洲、13个机构的分布式数据采集
    • 标准化硬件平台确保数据一致性
    • 为机器人领域的"ImageNet时刻"奠定基础
  2. 场景多样性的系统性分析

    • 提出了多维度的数据多样性分析框架
    • 量化了任务、物体、场景、视角、交互位置等维度
    • 为未来数据集构建提供了指导原则
  3. 工程质量与可复现性

    • 完整的硬件复现指南
    • 自动相机标定流程
    • 开源数据集、代码和预训练模型
  4. 实用性强

    • 真实家庭、办公室等场景的数据
    • 贴近实际应用的任务设计
    • 为机器人进入日常生活铺平道路

局限性

  1. 单一机器人形态

    • 仅使用Franka Panda机械臂
    • 缺少双臂、移动操作等形态
    • 限制了数据集的适用范围
  2. 任务复杂度有限

    • 主要是桌面操作任务
    • 缺少长序列、多步骤的复杂任务
    • 与真实世界的需求仍有差距
  3. 数据量相对有限

    • 76k轨迹相比NLP/CV领域仍然较小
    • 可能不足以训练大规模基础模型
    • 需要与其他数据集结合使用
  4. 采集效率问题

    • 每个场景约20分钟,效率较低
    • 需要专业人员操作
    • 难以进一步扩大规模

未来方向

  1. 多机器人形态扩展

    • 纳入双臂、移动操作、四足机器人等
    • 探索跨形态迁移学习
    • 构建更通用的机器人数据集
  2. 任务复杂度提升

    • 长序列任务(如烹饪完整菜肴)
    • 移动操作(如在厨房中取物)
    • 人机协作任务
  3. 数据采集自动化

    • 探索自主数据采集(如使用脚本化策略)
    • 结合仿真生成数据
    • 降低人力成本
  4. 与基础模型融合

    • 探索DROID与VLM、LLM的结合
    • 利用互联网知识增强泛化
    • 实现语言驱动的通用操作

📖 延伸阅读

  1. Open X-Embodiment: Open X-Embodiment Collaboration, “Open X-Embodiment: Robotic Learning Datasets and RT-X Models”, ICRA 2024
  2. RT-1: Brohan et al., “RT-1: Robotics Transformer for Real-World Control at Scale”, RSS 2023
  3. RH20T: Fang et al., “RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot”, 2023
  4. Bridge V2: Walke et al., “BridgeData V2: A Dataset for Robot Learning at Scale”, CoRL 2023
  5. Diffusion Policy: Chi et al., “Diffusion Policy: Visuomotor Policy Learning via Action Diffusion”, RSS 2023

本文为论文精读系列第2篇,聚焦具身智能领域的大规模真实世界机器人操作数据集。