📄 论文信息

- 标题:DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset(DROID:大规模真实世界机器人操作数据集)
- 团队:Stanford、UC Berkeley、Toyota Research Institute、Google DeepMind等18家机构
- 发表:CoRL 2024 / arXiv 2024.03
- 关键词:真实世界数据集、分布式采集、场景多样性、机器人操作、泛化能力
- 一句话总结:首个跨越三大洲、564个真实场景的大规模机器人操作数据集,显著提升策略性能与泛化能力
- 论文链接:arXiv:2403.12945
- 代码链接:droid-dataset.github.io
🤔 要解决什么问题?
真实世界数据采集的困境
在机器人操作领域,数据多样性是训练泛化策略的关键。然而,现有的机器人数据集面临一个根本性矛盾:
实验室数据的局限性:
- 大多数数据集在受控的实验室环境中采集
- 场景单一、光照固定、物体有限
- 训练出的策略难以泛化到真实世界
真实世界采集的挑战:
- 将机器人部署到不同环境面临后勤和安全挑战
- 需要大量的硬件和人力投入
- 不同机构的硬件不一致导致数据难以整合
现有数据集的不足:
| 数据集 | 轨迹数 | 场景数 | 语言标注 | 相机标定 |
|---|---|---|---|---|
| RT-1 | 130k | 2 | ✓ | ✗ |
| RH20T | 13k | 7 | ✓ | ✓ |
| Bridge V2 | 60k | 24 | ✓ | ✗ |
| Open X-Embodiment | 1.4M | 311 | (✓) | ✗ |
| DROID | 76k | 564 | ✓ | ✓ |
核心问题
论文试图解决的核心问题是:
如何构建一个既大规模又高多样性、既高质量又易于复现的机器人操作数据集,以支持训练更加鲁棒和泛化的操作策略?
具体来说,需要回答:
- 如何在不同地点、不同机构之间实现一致的数据采集?
- 如何确保数据的场景多样性和任务多样性?
- 如何保证数据的质量和可用性(相机标定、语言标注等)?
💡 核心方法
1. DROID硬件平台设计
为了实现跨机构的一致数据采集,DROID团队设计了一个标准化的机器人平台:

硬件配置:
- 机器人:Franka Emika Panda 7DoF机械臂 + Robotiq 2F-85夹爪
- 相机:
- 2个外部Zed 2立体相机(可调节三脚架安装)
- 1个腕部Zed Mini立体相机
- 控制器:Meta Quest 2 VR头显 + 手柄(6D位姿控制)
- 计算:Franka控制盒 + NUC(Polymetis服务器)+ Alienware笔记本(数据采集GUI)
- 移动性:安装在带轮子的可调节高度桌面上
设计原则:
- 可移植性:整个平台可通过单根电源线供电,便于在不同场景间移动
- 可复现性:所有13个机构使用完全相同的硬件配置
- 灵活性:相机视角可快速调整以适应新场景
2. 分布式数据采集协议
DROID的核心创新在于其分布式数据采集协议:

采集流程:
- 将机器人移动到新场景
- 调整第三人称相机视角
- 使用棋盘格进行外参标定
- 在GUI中输入当前场景的潜在任务列表
- 系统随机采样任务提示采集者
- 定期执行场景增强(移动底座、调整相机、改变光照、增减物体)
- 每个场景采集约100条轨迹或20分钟数据后转移到新场景
质量控制:
- 采集者标记每条轨迹是否成功
- 76k条成功轨迹(另有16k条失败轨迹也包含在数据集中)
- 通过tasq.ai平台进行众包语言标注,每条轨迹最多3条独立标注
3. 相机自动标定
由于手动标定在大规模采集中的局限性,DROID开发了自动后处理标定流程:
- 相机-基座标定:约36k个唯一场景的单相机标定
- 相机-相机标定:所有场景的双相机标定
- 精选子集:24k个场景的完整三相机标定
这显著提高了数据集在3D感知和几何理解任务中的可用性。
🧪 实验验证
实验设计
论文在6个任务、4个地点(实验室、办公室、真实家庭)进行了广泛的评估:

评估任务:
- 关闭华夫饼机:短视域任务,随机化位置(70条演示)
- 将薯片放到盘子上:拾取放置任务,新物体+干扰物
- 将苹果放入锅中:多阶段任务(拾取→放置→关盖)
- 烤面包:多阶段任务,新物体
- 清理桌面:打开抽屉→放入橡皮→关闭
- 煮扁豆:复杂多阶段任务(开盖→倒扁豆→开火)
对比方法:
- 无协同训练:仅使用任务特定数据
- Open X-Embodiment协同训练:使用OXE数据集
- DROID协同训练:使用DROID数据集
实验结果
1. 策略性能提升
| 设置 | 无协同训练 | OXE协同训练 | DROID协同训练 |
|---|---|---|---|
| 分布内 | 基准 | +15% | +22% |
| 分布外 | 基准 | +10% | +17% |
关键发现:
- DROID协同训练在所有任务上都显著提升性能
- 相比无协同训练,平均提升22%(分布内)和17%(分布外)
- 相比OXE协同训练,DROID也有显著优势
2. 场景多样性的重要性
论文进行了专门的消融实验来验证场景多样性的影响:
- 使用DROID的子集(仅单个场景)训练 → 性能显著下降
- 使用完整DROID(564个场景)训练 → 最佳性能
- 证明场景多样性是DROID成功的关键因素
3. 鲁棒性验证
在分布外评估中,DROID训练的策略表现出更强的鲁棒性:
- 干扰物鲁棒性:在桌面增加干扰物体后仍能成功
- 新物体泛化:对训练中未见过的物体实例也能操作
- 场景泛化:在不同的桌面布局和光照条件下工作
🔍 个人思考
亮点
真实世界数据采集的范式创新:
- 首次实现跨三大洲、13个机构的分布式数据采集
- 标准化硬件平台确保数据一致性
- 为机器人领域的"ImageNet时刻"奠定基础
场景多样性的系统性分析:
- 提出了多维度的数据多样性分析框架
- 量化了任务、物体、场景、视角、交互位置等维度
- 为未来数据集构建提供了指导原则
工程质量与可复现性:
- 完整的硬件复现指南
- 自动相机标定流程
- 开源数据集、代码和预训练模型
实用性强:
- 真实家庭、办公室等场景的数据
- 贴近实际应用的任务设计
- 为机器人进入日常生活铺平道路
局限性
单一机器人形态:
- 仅使用Franka Panda机械臂
- 缺少双臂、移动操作等形态
- 限制了数据集的适用范围
任务复杂度有限:
- 主要是桌面操作任务
- 缺少长序列、多步骤的复杂任务
- 与真实世界的需求仍有差距
数据量相对有限:
- 76k轨迹相比NLP/CV领域仍然较小
- 可能不足以训练大规模基础模型
- 需要与其他数据集结合使用
采集效率问题:
- 每个场景约20分钟,效率较低
- 需要专业人员操作
- 难以进一步扩大规模
未来方向
多机器人形态扩展:
- 纳入双臂、移动操作、四足机器人等
- 探索跨形态迁移学习
- 构建更通用的机器人数据集
任务复杂度提升:
- 长序列任务(如烹饪完整菜肴)
- 移动操作(如在厨房中取物)
- 人机协作任务
数据采集自动化:
- 探索自主数据采集(如使用脚本化策略)
- 结合仿真生成数据
- 降低人力成本
与基础模型融合:
- 探索DROID与VLM、LLM的结合
- 利用互联网知识增强泛化
- 实现语言驱动的通用操作
📖 延伸阅读
- Open X-Embodiment: Open X-Embodiment Collaboration, “Open X-Embodiment: Robotic Learning Datasets and RT-X Models”, ICRA 2024
- RT-1: Brohan et al., “RT-1: Robotics Transformer for Real-World Control at Scale”, RSS 2023
- RH20T: Fang et al., “RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot”, 2023
- Bridge V2: Walke et al., “BridgeData V2: A Dataset for Robot Learning at Scale”, CoRL 2023
- Diffusion Policy: Chi et al., “Diffusion Policy: Visuomotor Policy Learning via Action Diffusion”, RSS 2023
本文为论文精读系列第2篇,聚焦具身智能领域的大规模真实世界机器人操作数据集。