Volver a Datasets

RoboNet: El Corpus Video de Cross-Robot Original

Explore RoboNet: 15M de fotogramas de video en 7 robots y 4 laboratorios. descarga, entrena modelos de predicción de video y previsión visual, y compara la transferencia de robots en un fin de semana.

Una guía para practicantes de RoboNet el conjunto de datos de 15 millones de marcos, 7 robots, 4 laboratorios que estableció la plantilla para cada lanzamiento de múltiples robots a gran escala que siguió.

TL;DR

Metric Value
Frame count ~15,000,000 RGB video frames
Robots 7 (Sawyer, Baxter, WidowX, Kuka iiwa, Franka, Fetch, Widow200)
Modalities RGB video (1-4 cameras), Cartesian delta action, proprioception, gripper
License MIT
Institutions 4 labs (Penn, Stanford, UC Berkeley, CMU)
Original paper CoRL 2019 (Dasari et al.)

¿Qué es RoboNet?

RoboNet fue el primer intento serio de responder a una pregunta muy específica: si varios laboratorios unifican sus videos de robots recogidos de forma autónoma, ¿puede un solo modelo de predicción de video generalizarse a través de robots y entornos? Sudeep Dasari y colaboradores de Penn, Stanford, UC Berkeley y CMU reunieron 15 millones de fotogramas de video de 7 plataformas de robots diferentes y los lanzaron con un esquema HDF5 unificado, un logro notable en 2019, cuando los conjuntos de datos de robots eran generalmente privados de laboratorio y específicos del protocolo.

RoboNet es un conjunto de datos de predicción de video, no un conjunto de datos de manipulación con condiciones de lenguaje. La mayoría de los episodios se recopilan de forma autónoma (exploración aleatoria o guionada frente a objetos variados), no demostraciones de expertos teleoperadas. Esa elección de diseño hizo de RoboNet el punto de referencia para modelos de video estocásticos (SVG, SVP, SV2P), planificadores de previsión visual y control basado en modelos mundiales durante años, y dio forma a la forma en que el campo ahora piensa sobre predicción accionable en función de la acción de robots.

Aunque RoboNet ha sido superado por Open X-Embodiment y DROID en tamaño bruto, sigue siendo el conjunto de datos de robots cruzados más limpio, más pequeño y pedagógicamente útil. Su esquema acciones delta cartesianas, etiqueta de realización por robot, 64x64 o 128x128 RGB es todavía el más fácil de levantar una línea base de predicción de video cruzado en una sola GPU.

Cómo descargar y cargar

La distribución canónica es un conjunto de HDF5 shards en la wiki RoboNet, con un espejo TFRecord enviado a través del repo de referencia GitHub:

# Pull the reference code
git clone https://github.com/SudeepDasari/RoboNet.git
cd RoboNet && pip install -e .

# Download the HDF5 shards (see https://www.robonet.wiki/ for bucket URLs)
python robonet/datasets/download_robonet.py --output_dir ./data

# Load episodes with the built-in reader
from robonet.datasets.robonet_dataset import RoboNetDataset
ds = RoboNetDataset(
    batch_size=32,
    dataset_files=["./data/*.hdf5"],
    hparams={"img_size": [64, 64], "load_random_cam": True},
)
for batch in ds:
    print(batch["images"].shape, batch["actions"].shape, batch["states"].shape)

Debido a que los marcos son pequeños (64x64 o 128x128) y los vectores de acción son cortos, RoboNet es uno de los raros conjuntos de datos de robots donde se puede ejecutar un experimento significativo en una GPU de un solo consumidor.

Casos de uso comunes y emparejamientos de modelos

  • Líneas de base de predicción de vídeo. SVG, SVP, FitVid y la pila original de Visión Visual Foresight utilizan RoboNet como su referencia cruzada de robots.
  • Control basado en el modelo mundial. Las secuencias de acción/observación combinadas lo convierten en un banco de pruebas natural para modelos mundiales de estilo Dreamer en un entorno de múltiples encarnaciones.
  • ** Investigación de codificación de embodios.** Debido a que cada fragmento está etiquetado con un ID de robot, RoboNet es un blanco limpio para aprender embedios de embodios que se transfieren a nuevos brazos.
  • Enseñanza / cursos. El pequeño tamaño de los cuadros y el esquema HDF5 limpio hacen de RoboNet el conjunto de datos predeterminado en las clases de aprendizaje de robots de posgrado.

Indicadores de referencia y tablas de clasificación

No hay tabla de clasificación cerrada, pero la evaluación estándar es PSNR / SSIM / LPIPS en predicción de marco futuro de 10 pasos condicionada a una secuencia de acción prolongada, reportada por separado para robots vistos y no vistos.

Inmersión técnica profunda: acciones del delta cartesiano e identificaciones de realización

La representación de acción de RoboNet fue inusualmente ambiciosa para 2019. En lugar de registrar objetivos conjuntos en bruto o comandos motores (que diferirían entre cada robot), los autores mapearon cada acción en un delta cartesiano de 5 dimensiones: traducción xyz más rotación de jaula más un bit de agarre binario. El pitch and roll se mantuvo fijo porque la mayoría de los robots contribuyentes solo soportaban la captura de arriba hacia abajo en la configuración de la colección. Esta normalización es lo que permite que un modelo de predicción de video único se condicione a las acciones de siete brazos diferentes.

Cada trayectoria está etiquetada con un número entero de ID de realización que las políticas pueden ignorar (para aprender un modelo genérico de robots cruzados) o condicionar (para explotar la dinámica específica del robot). Este último enfoque aprendió embeddings de realización se convirtió en uno de los patrones dominantes en la literatura de seguimiento y inspiró directamente las incorporaciones por conjunto de datos utilizadas en Octo y el esquema de normalización de acción en OpenVLA.

Los fotogramas de vídeo se almacenan a baja resolución (64x64 o 128x128 según el fragmento) específicamente para que las líneas de base de predicción de video puedan ejecutarse en hardware de productos básicos. Si necesita imágenes de mayor resolución, Open X-Embodiment y DROID son ambos barcos de RGB de resolución completa y deben ser preferidos para las tuberías modernas pesadas en visión.

Las limitaciones conocidas

  • Baja resolución. Los fotogramas 64x64 o 128x128 no son útiles para las políticas modernas basadas en píxeles. RoboNet es una referencia histórica, no un objetivo de formación para los sistemas de producción.
  • ** Datos autónomos (no expertos).*** La mayoría de las trayectorias son exploración aleatoria, por lo que RoboNet no es adecuado para el aprendizaje de imitación nunca fue destinado a serlo.
  • ** Solo espacio de acción de arriba hacia abajo.** La normalización de 5-DoF reduce el ritmo y el rollo, lo que limita el repertorio de manipulación a la captura plana.
  • No se anotan en lenguaje. Los episodios están etiquetados con identificadores de robots y entornos pero no con lenguaje natural, por lo que RoboNet no puede pre-entrenar las políticas condicionadas por el lenguaje.

Las preguntas frecuentes

¿Sigue valiendo la pena utilizar RoboNet en 2026? Sí, por dos razones: sigue siendo el mejor conjunto de datos de enseñanza para predicción de video trans-embodimental, y su pequeño tamaño lo hace ideal para estudios de ablación que serían demasiado caros en Open X-Embodiment.

** ¿Cómo se compara RoboNet con Open X-Embodiment? ** OXE es 50-100 veces más grande, incluye demostraciones de expertos y envío de anotaciones de lenguaje. RoboNet es más pequeño, sólo para video y basado en la exploración autónoma. Son complementarios.

** ¿Puedo combinar RoboNet con conjuntos de datos modernos etiquetados con acción? ** Sí el esquema de acción etiquetado con la realización es compatible con la mayoría de las pilas de entrenamiento VLA modernas con código de adaptador menor.