El cuerpo X abierto: Datos de entrenamiento de robots cruzados
Explore Open X-Embodiment: 1M+ trayectorias en 22 encarnaciones de robots y 527 habilidades.
Guía de un profesional para el Open X-Embodiment (OXE)
TL;DR
| Metric | Value |
|---|---|
| Task count | 160,000 tasks spanning 527 distinct skills |
| Robots | 22 embodiments (Franka, UR5, WidowX, xArm, Google Robot, Sawyer, Kuka iiwa, and 15 more) |
| Modalities | RGB (1-4 cameras), depth (subset), proprioception, gripper state, natural language |
| License | Apache 2.0 for most contributions (per-subset licenses vary) |
| Size | 1,000,000+ real-robot episodes, ~4 TB RLDS |
| Hosting | Google Cloud Storage (gs://gresearch/robotics) and HuggingFace |
¿Qué es el cuerpo abierto?
El Open X-Embodiment (OXE) es el primer intento serio de unificar el mundo fragmentado de datos de demostración de robots reales en un solo corpus pre-entrenamiento. Lanzado a finales de 2023 por Google DeepMind y una coalición de 33 laboratorios académicos e industriales, el conjunto de datos agrega 60 conjuntos de datos de aprendizaje de robots preexistentes, recodifica cada trayectoria en el formato estándar RLDS (Reinforcement Learning Datasets), y los envía detrás de un punto final de descarga. Los números principales son 1.000.000+ trayectorias de robots, 22 encarnaciones de robots, 527 habilidades y 160.000 tareas distintas.
El argumento intelectual detrás de OXE es que la robótica se ha quedado atrapada en la escala "por laboratorio, por robot" de datos de capacitación mientras que los modelos de visión y lenguaje se escalaron a toda Internet. Mediante la normalización de los espacios de acción y observación en cada una de las realizaciones, la colaboración mostró que un único transformador
OXE no es un conjunto de datos limpio único
Cómo descargar y cargar
OXE se distribuye como fragmentos RLDS en Google Cloud Storage. Puede transmitir subdatasets individuales sin descargar los 4 TB completos:
# Install the RLDS/TFDS tooling
pip install tensorflow_datasets rlds
# List the available sub-datasets
python -c "from tensorflow_datasets.robotics import rtx; print(rtx.RTX_BUILDERS)"
# Stream the BridgeData V2 subset directly from GCS
import tensorflow_datasets as tfds
ds = tfds.load(
"bridge",
data_dir="gs://gresearch/robotics",
split="train[:1000]",
)
for ep in ds.take(1):
for step in ep["steps"]:
print(step["observation"]["image"].shape, step["action"].shape)
# Or use the HuggingFace Parquet mirror
pip install datasets
python -c "from datasets import load_dataset; ds = load_dataset('jxu124/OpenX-Embodiment', 'fractal20220817_data', split='train', streaming=True)"
Para entrenar un VLA, la mayoría de los equipos reutiliza la lista de filtros OpenX mix del repo OpenVLA, que elimina las contribuciones de menor calidad y reequilibra la distribución.
Casos de uso comunes y emparejamientos de modelos
- ** Preentrenamiento VLA.** OpenVLA, RT-2-X, Octo y Pi-0 todos preentrenamiento en la mezcla OpenX antes de ajuste fino en un conjunto de datos objetivo como LIBERO o una colección personalizada.
- Estudios de transferencia de cuerpos cruzados. OXE es el único conjunto de datos en el que se puede entrenar en 21 robots y evaluar el tiro cero en el 22 con poder estadístico.
- ** Investigación de normalización del espacio de acción.** La heterogeneidad de los modos de control de los efectos finales (delta cartesiano, velocidad conjunta, binario de agarre) hace de OXE el banco de pruebas predeterminado para tokenizadores de acción unificados.
- Experimentos de ley de escala de datos. Debido a que los subdatasets abarcan cuatro órdenes de magnitud en tamaño, OXE le permite instalar curvas de escala limpias sin recopilar nuevos datos.
Indicadores de referencia y tablas de clasificación
OXE en sí es un corpus de entrenamiento, no un punto de referencia cerrado, por lo que las evaluaciones ocurren en suites de aguas subidas. Consulte el Documentos con código abierto en el código de la X-Entidad, la página oficial del proyecto RT-X, y el documento RT-X (arXiv:2310.08864) para obtener las métricas de referencia.
Inmersión técnica profunda: el espacio de acción RLDS
Una de las partes más complicadas de trabajar con Open X-Embodiment es que cada laboratorio contribuyente tenía su propia convención para expresar una acción robótica. El equipo de OXE resolvió esto estandarizando en un esquema RLDS en el que cada episodio es una secuencia de
La mayoría de las recetas modernas de entrenamiento de VLA (OpenVLA, Octo, RT-2-X) manejan esta heterogeneidad aprendiendo un normalizar por conjunto de datos y una salida de acción delta cartesiana unificada de 7 dimensiones, luego proyectando de nuevo al espacio nativo en el momento de la evaluación.
Las observaciones son igualmente no uniformes. Algunos conjuntos de datos tienen cuatro cámaras, algunos tienen una, y las resoluciones de la imagen van desde 128x128 a 640x480. El truco estándar de preprocesamiento es cambiar el tamaño a 224x224 y seleccionar al azar una cámara por paso durante el entrenamiento
Las limitaciones conocidas
- Varianza de calidad. No todos los subconjuntos de datos son teleoperaciones expertas. Algunas contribuciones son datos generados de forma autónoma con guión con éxito mixto. La lista de filtros OpenVLA es el mejor intento de la comunidad en un nivel de calidad.
- Gapas en la anotación del lenguaje. Aproximadamente el 30% de los episodios carecen de instrucciones en lenguaje natural; el preentrenamiento VLA se completa normalmente con un token de lugar.
- La cobertura de profundidad es delgada. Sólo un puñado de subconjuntos de datos incluyen profundidad, lo que limita la utilidad de OXE para políticas 3D completas.
- Fragmentación de licencias. La mayoría de las contribuciones son Apache 2.0, pero un puñado son solo de investigación. Si planeas ajustar un producto comercial en OXE, revisa la tabla de licencias por conjunto de datos.
Las preguntas frecuentes
¿Debería entrenar en todo OXE o solo en la mezcla OpenX? Comience con la mezcla OpenX
Cuánto tiempo tarda el preentrenamiento? Aproximadamente 4-7 días en 8xH100 para un modelo a escala OpenVLA-7B en la mezcla OpenX, o 1-2 días para un modelo a escala Octo más pequeño.
** ¿Puedo ajustar bien OpenVLA en mis propios datos sin OXE? ** Sí







