Volver a Datasets

El cuerpo X abierto: Datos de entrenamiento de robots cruzados

Explore Open X-Embodiment: 1M+ trayectorias en 22 encarnaciones de robots y 527 habilidades.

Guía de un profesional para el Open X-Embodiment (OXE) la trayectoria de 1M, 22 embodamientos, corpus de 60 conjuntos de datos que hicieron posible los modelos modernos de base de robots.

TL;DR

Metric Value
Task count 160,000 tasks spanning 527 distinct skills
Robots 22 embodiments (Franka, UR5, WidowX, xArm, Google Robot, Sawyer, Kuka iiwa, and 15 more)
Modalities RGB (1-4 cameras), depth (subset), proprioception, gripper state, natural language
License Apache 2.0 for most contributions (per-subset licenses vary)
Size 1,000,000+ real-robot episodes, ~4 TB RLDS
Hosting Google Cloud Storage (gs://gresearch/robotics) and HuggingFace

¿Qué es el cuerpo abierto?

El Open X-Embodiment (OXE) es el primer intento serio de unificar el mundo fragmentado de datos de demostración de robots reales en un solo corpus pre-entrenamiento. Lanzado a finales de 2023 por Google DeepMind y una coalición de 33 laboratorios académicos e industriales, el conjunto de datos agrega 60 conjuntos de datos de aprendizaje de robots preexistentes, recodifica cada trayectoria en el formato estándar RLDS (Reinforcement Learning Datasets), y los envía detrás de un punto final de descarga. Los números principales son 1.000.000+ trayectorias de robots, 22 encarnaciones de robots, 527 habilidades y 160.000 tareas distintas.

El argumento intelectual detrás de OXE es que la robótica se ha quedado atrapada en la escala "por laboratorio, por robot" de datos de capacitación mientras que los modelos de visión y lenguaje se escalaron a toda Internet. Mediante la normalización de los espacios de acción y observación en cada una de las realizaciones, la colaboración mostró que un único transformador RT-1-X y posteriormente RT-2-X podría ser preentrenado en el corpus completo y luego transferido a cero-shot a nuevos robots con transferencia positiva. Este es el resultado que finalmente produjo OpenVLA, Octo y la generación actual de modelos de fundación VLA, todos los cuales utilizan OXE (o un subconjunto curado llamado OpenX mix) como su base de preentrenamiento.

OXE no es un conjunto de datos limpio único es una unión de fuentes heterogéneas, desde corporaciones de teleoperación a gran escala como BridgeData V2 y RT-1 hasta conjuntos de datos a escala de laboratorio como Jaco Play y NYU Franka Play. Cada contribución conserva su licencia original (la mayoría son Apache 2.0 o CC-BY, algunos son solo de investigación), y los investigadores suelen filtrar la mezcla por experimento en lugar de entrenar en la unión cruda.

Cómo descargar y cargar

OXE se distribuye como fragmentos RLDS en Google Cloud Storage. Puede transmitir subdatasets individuales sin descargar los 4 TB completos:

# Install the RLDS/TFDS tooling
pip install tensorflow_datasets rlds

# List the available sub-datasets
python -c "from tensorflow_datasets.robotics import rtx; print(rtx.RTX_BUILDERS)"

# Stream the BridgeData V2 subset directly from GCS
import tensorflow_datasets as tfds
ds = tfds.load(
    "bridge",
    data_dir="gs://gresearch/robotics",
    split="train[:1000]",
)
for ep in ds.take(1):
    for step in ep["steps"]:
        print(step["observation"]["image"].shape, step["action"].shape)

# Or use the HuggingFace Parquet mirror
pip install datasets
python -c "from datasets import load_dataset; ds = load_dataset('jxu124/OpenX-Embodiment', 'fractal20220817_data', split='train', streaming=True)"

Para entrenar un VLA, la mayoría de los equipos reutiliza la lista de filtros OpenX mix del repo OpenVLA, que elimina las contribuciones de menor calidad y reequilibra la distribución.

Casos de uso comunes y emparejamientos de modelos

  • ** Preentrenamiento VLA.** OpenVLA, RT-2-X, Octo y Pi-0 todos preentrenamiento en la mezcla OpenX antes de ajuste fino en un conjunto de datos objetivo como LIBERO o una colección personalizada.
  • Estudios de transferencia de cuerpos cruzados. OXE es el único conjunto de datos en el que se puede entrenar en 21 robots y evaluar el tiro cero en el 22 con poder estadístico.
  • ** Investigación de normalización del espacio de acción.** La heterogeneidad de los modos de control de los efectos finales (delta cartesiano, velocidad conjunta, binario de agarre) hace de OXE el banco de pruebas predeterminado para tokenizadores de acción unificados.
  • Experimentos de ley de escala de datos. Debido a que los subdatasets abarcan cuatro órdenes de magnitud en tamaño, OXE le permite instalar curvas de escala limpias sin recopilar nuevos datos.

Indicadores de referencia y tablas de clasificación

OXE en sí es un corpus de entrenamiento, no un punto de referencia cerrado, por lo que las evaluaciones ocurren en suites de aguas subidas. Consulte el Documentos con código abierto en el código de la X-Entidad, la página oficial del proyecto RT-X, y el documento RT-X (arXiv:2310.08864) para obtener las métricas de referencia.

Inmersión técnica profunda: el espacio de acción RLDS

Una de las partes más complicadas de trabajar con Open X-Embodiment es que cada laboratorio contribuyente tenía su propia convención para expresar una acción robótica. El equipo de OXE resolvió esto estandarizando en un esquema RLDS en el que cada episodio es una secuencia de T2 tuples, y cada subconjunto de datos documenta su propia semántica de campo T3 típicamente 7 dimensiones para un brazo de 6-DoF más un agarre binario, o 14 dimensiones para una plataforma bimanual.

La mayoría de las recetas modernas de entrenamiento de VLA (OpenVLA, Octo, RT-2-X) manejan esta heterogeneidad aprendiendo un normalizar por conjunto de datos y una salida de acción delta cartesiana unificada de 7 dimensiones, luego proyectando de nuevo al espacio nativo en el momento de la evaluación.

Las observaciones son igualmente no uniformes. Algunos conjuntos de datos tienen cuatro cámaras, algunos tienen una, y las resoluciones de la imagen van desde 128x128 a 640x480. El truco estándar de preprocesamiento es cambiar el tamaño a 224x224 y seleccionar al azar una cámara por paso durante el entrenamiento una opción que sacrifica cierta información pero simplifica drásticamente la línea de entrenamiento y permite a un solo transformador ingerir cualquier encarnación.

Las limitaciones conocidas

  • Varianza de calidad. No todos los subconjuntos de datos son teleoperaciones expertas. Algunas contribuciones son datos generados de forma autónoma con guión con éxito mixto. La lista de filtros OpenVLA es el mejor intento de la comunidad en un nivel de calidad.
  • Gapas en la anotación del lenguaje. Aproximadamente el 30% de los episodios carecen de instrucciones en lenguaje natural; el preentrenamiento VLA se completa normalmente con un token de lugar.
  • La cobertura de profundidad es delgada. Sólo un puñado de subconjuntos de datos incluyen profundidad, lo que limita la utilidad de OXE para políticas 3D completas.
  • Fragmentación de licencias. La mayoría de las contribuciones son Apache 2.0, pero un puñado son solo de investigación. Si planeas ajustar un producto comercial en OXE, revisa la tabla de licencias por conjunto de datos.

Las preguntas frecuentes

¿Debería entrenar en todo OXE o solo en la mezcla OpenX? Comience con la mezcla OpenX deja caer las contribuciones más ruidosas y le da una base fuerte en una fracción del cálculo. Agregue el corpus completo solo si está persiguiendo los últimos 1-2 puntos de tasa de éxito.

Cuánto tiempo tarda el preentrenamiento? Aproximadamente 4-7 días en 8xH100 para un modelo a escala OpenVLA-7B en la mezcla OpenX, o 1-2 días para un modelo a escala Octo más pequeño.

** ¿Puedo ajustar bien OpenVLA en mis propios datos sin OXE? ** Sí OpenVLA envía un punto de control preentrenado, por lo que solo necesitas OXE si quieres volver a ejecutar el preentrenamiento desde cero.