Volver a Datasets

DROID: Datos de interacción de robots distribuidos

DROID: 76K trayectorias, 350 horas, 86 tareas en 564 escenas reales en Franka Panda.

76.000 trayectorias teleópicas del mundo real en 564 escenas el conjunto de datos de manipulación de un solo brazo más grande y el corpus canónico de preentrenamiento para OpenVLA, π0, y Octo.

TL;DR

Metric Value
Task count 86 distinct task descriptions (open vocabulary language)
Robots Franka Emika Panda with parallel-jaw gripper
Modalities 2x Zed 2 stereo RGB-D + 1x Zed Mini wrist + language + 7-DoF joints
License CC-BY 4.0
Size 76K trajectories, 350 hours, ~1.7 TB RLDS
Scenes 564 real-world environments across 18 institutions

¿Qué es DROID?

DROID (Distributed Robot Interaction Dataset) es el resultado de un consorcio liderado por Stanford y UC Berkeley de 18 instituciones que juntas recogieron el mayor conjunto de datos de manipulación de robots disponibles públicamente en el medio silvestre. La publicación de datos fue anunciada a principios de 2024 y captura 350 horas de interacción teleoperada Franka Emika Panda que abarca 76,000 episodios en 564 escenas del mundo real distintas: cocinas, oficinas, laboratorios, habitaciones de hoteles, espacios de trabajo industriales, incluso una tienda de conveniencia.

La elección clave de diseño que diferencia a DROID de los conjuntos de datos del mundo real anteriores es su compromiso con la diversidad de escenarios sobre la profundidad de la tarea. En lugar de registrar miles de ensayos de un pequeño conjunto de primitivas de manipulación, DROID recogió una larga cola de 86 descripciones de tareas distintas (lenguaje de vocabulario abierto como "verter el cereal en el tazón" o "borrar el café derramado") en cientos de fondos únicos. La distribución resultante es mucho más difícil de memorizar para las políticas y refleja mucho más las condiciones reales de despliegue.

Cada episodio de DROID se lanza con tres cámaras RGB-D estéreo dos unidades Zed 2 montadas externamente más una Zed Mini montada en la muñeca a una velocidad constante de 15 Hz, junto con el estado conjunto 7-DoF de la Franka, la posición del efecto final, el ancho del agarre y una instrucción de lenguaje natural. El conjunto de datos se distribuye en el formato RLDS / TFDS utilizado por Open X-Embodiment y se refleja en Hugging Face como Parquet en formato LeRobot.

Cómo descargar y cargar

# Install TFDS + the DROID spec
pip install tensorflow_datasets rlds tensorflow
python -c "
import tensorflow_datasets as tfds
ds = tfds.load('droid', data_dir='gs://gresearch/robotics/droid/1.0.0')['train']
for ep in ds.take(1):
    print(ep.keys())"

# Or stream via LeRobot
pip install lerobot
python -c "
from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
d = LeRobotDataset('KarlP/droid', streaming=True)
print(next(iter(d)))"

El espejo completo se aloja en Google Cloud Storage bajo T1 y es libre de salida. Una muestra de 100 episodios "DROID-100" se empaqueta en Hugging Face para una experimentación rápida y se ajusta a una computadora portátil.

Casos de uso comunes y emparejamientos

  • VLA pre-entrenamiento. OpenVLA, π0, Octo y la familia RT-2-X incluyen todos DROID en su mezcla pre-entrenamiento proporciona la diversidad de escena de cola larga que los datos de encarnación cruzada no pueden proporcionar solos.
  • Atulado en una sola escena. Los equipos frecuentemente se preparan en DROID y se ajustan a las 50 demostraciones de su tarea objetivo recogidas en su propio laboratorio.
  • Lenguaje de tierra. Debido a que las tareas se describen en vocabulario abierto inglés, DROID es el mejor conjunto de datos público para evaluar la CLIP / VLM de tierra en datos reales de robots.
  • Estudios de derecho de escala. El tamaño de DROID permite a los investigadores caracterizar cómo mejora la tasa de éxito con la fracción de conjunto de datos una señal no disponible en conjuntos de datos más pequeños.

Indicadores de referencia y tablas de clasificación

DROID se utiliza principalmente como datos de preentrenamiento en lugar de un punto de referencia fijo, pero el repositorio de aprendizaje de políticas publica números de referencia de Política de difusión y ACT en la división DROID-100.