RoboNet: El Corpus Video de Cross-Robot Original
Explore RoboNet: 15M de fotogramas de video en 7 robots y 4 laboratorios. descarga, entrena modelos de predicción de video y previsión visual, y compara la transferencia de robots en un fin de semana.
Una guía para practicantes de RoboNet
TL;DR
| Metric | Value |
|---|---|
| Frame count | ~15,000,000 RGB video frames |
| Robots | 7 (Sawyer, Baxter, WidowX, Kuka iiwa, Franka, Fetch, Widow200) |
| Modalities | RGB video (1-4 cameras), Cartesian delta action, proprioception, gripper |
| License | MIT |
| Institutions | 4 labs (Penn, Stanford, UC Berkeley, CMU) |
| Original paper | CoRL 2019 (Dasari et al.) |
¿Qué es RoboNet?
RoboNet fue el primer intento serio de responder a una pregunta muy específica: si varios laboratorios unifican sus videos de robots recogidos de forma autónoma, ¿puede un solo modelo de predicción de video generalizarse a través de robots y entornos? Sudeep Dasari y colaboradores de Penn, Stanford, UC Berkeley y CMU reunieron 15 millones de fotogramas de video de 7 plataformas de robots diferentes y los lanzaron con un esquema HDF5 unificado, un logro notable en 2019, cuando los conjuntos de datos de robots eran generalmente privados de laboratorio y específicos del protocolo.
RoboNet es un conjunto de datos de predicción de video, no un conjunto de datos de manipulación con condiciones de lenguaje. La mayoría de los episodios se recopilan de forma autónoma (exploración aleatoria o guionada frente a objetos variados), no demostraciones de expertos teleoperadas. Esa elección de diseño hizo de RoboNet el punto de referencia para modelos de video estocásticos (SVG, SVP, SV2P), planificadores de previsión visual y control basado en modelos mundiales durante años, y dio forma a la forma en que el campo ahora piensa sobre predicción accionable en función de la acción de robots.
Aunque RoboNet ha sido superado por Open X-Embodiment y DROID en tamaño bruto, sigue siendo el conjunto de datos de robots cruzados más limpio, más pequeño y pedagógicamente útil. Su esquema
Cómo descargar y cargar
La distribución canónica es un conjunto de HDF5 shards en la wiki RoboNet, con un espejo TFRecord enviado a través del repo de referencia GitHub:
# Pull the reference code
git clone https://github.com/SudeepDasari/RoboNet.git
cd RoboNet && pip install -e .
# Download the HDF5 shards (see https://www.robonet.wiki/ for bucket URLs)
python robonet/datasets/download_robonet.py --output_dir ./data
# Load episodes with the built-in reader
from robonet.datasets.robonet_dataset import RoboNetDataset
ds = RoboNetDataset(
batch_size=32,
dataset_files=["./data/*.hdf5"],
hparams={"img_size": [64, 64], "load_random_cam": True},
)
for batch in ds:
print(batch["images"].shape, batch["actions"].shape, batch["states"].shape)
Debido a que los marcos son pequeños (64x64 o 128x128) y los vectores de acción son cortos, RoboNet es uno de los raros conjuntos de datos de robots donde se puede ejecutar un experimento significativo en una GPU de un solo consumidor.
Casos de uso comunes y emparejamientos de modelos
- Líneas de base de predicción de vídeo. SVG, SVP, FitVid y la pila original de Visión Visual Foresight utilizan RoboNet como su referencia cruzada de robots.
- Control basado en el modelo mundial. Las secuencias de acción/observación combinadas lo convierten en un banco de pruebas natural para modelos mundiales de estilo Dreamer en un entorno de múltiples encarnaciones.
- ** Investigación de codificación de embodios.** Debido a que cada fragmento está etiquetado con un ID de robot, RoboNet es un blanco limpio para aprender embedios de embodios que se transfieren a nuevos brazos.
- Enseñanza / cursos. El pequeño tamaño de los cuadros y el esquema HDF5 limpio hacen de RoboNet el conjunto de datos predeterminado en las clases de aprendizaje de robots de posgrado.
Indicadores de referencia y tablas de clasificación
No hay tabla de clasificación cerrada, pero la evaluación estándar es PSNR / SSIM / LPIPS en predicción de marco futuro de 10 pasos condicionada a una secuencia de acción prolongada, reportada por separado para robots vistos y no vistos.
Inmersión técnica profunda: acciones del delta cartesiano e identificaciones de realización
La representación de acción de RoboNet fue inusualmente ambiciosa para 2019. En lugar de registrar objetivos conjuntos en bruto o comandos motores (que diferirían entre cada robot), los autores mapearon cada acción en un delta cartesiano de 5 dimensiones: traducción xyz más rotación de jaula más un bit de agarre binario. El pitch and roll se mantuvo fijo porque la mayoría de los robots contribuyentes solo soportaban la captura de arriba hacia abajo en la configuración de la colección. Esta normalización es lo que permite que un modelo de predicción de video único se condicione a las acciones de siete brazos diferentes.
Cada trayectoria está etiquetada con un número entero de ID de realización que las políticas pueden ignorar (para aprender un modelo genérico de robots cruzados) o condicionar (para explotar la dinámica específica del robot). Este último enfoque
Los fotogramas de vídeo se almacenan a baja resolución (64x64 o 128x128 según el fragmento) específicamente para que las líneas de base de predicción de video puedan ejecutarse en hardware de productos básicos. Si necesita imágenes de mayor resolución, Open X-Embodiment y DROID son ambos barcos de RGB de resolución completa y deben ser preferidos para las tuberías modernas pesadas en visión.
Las limitaciones conocidas
- Baja resolución. Los fotogramas 64x64 o 128x128 no son útiles para las políticas modernas basadas en píxeles. RoboNet es una referencia histórica, no un objetivo de formación para los sistemas de producción.
- ** Datos autónomos (no expertos).*** La mayoría de las trayectorias son exploración aleatoria, por lo que RoboNet no es adecuado para el aprendizaje de imitación
nunca fue destinado a serlo. - ** Solo espacio de acción de arriba hacia abajo.** La normalización de 5-DoF reduce el ritmo y el rollo, lo que limita el repertorio de manipulación a la captura plana.
- No se anotan en lenguaje. Los episodios están etiquetados con identificadores de robots y entornos pero no con lenguaje natural, por lo que RoboNet no puede pre-entrenar las políticas condicionadas por el lenguaje.
Las preguntas frecuentes
¿Sigue valiendo la pena utilizar RoboNet en 2026? Sí, por dos razones: sigue siendo el mejor conjunto de datos de enseñanza para predicción de video trans-embodimental, y su pequeño tamaño lo hace ideal para estudios de ablación que serían demasiado caros en Open X-Embodiment.
** ¿Cómo se compara RoboNet con Open X-Embodiment? ** OXE es 50-100 veces más grande, incluye demostraciones de expertos y envío de anotaciones de lenguaje. RoboNet es más pequeño, sólo para video y basado en la exploración autónoma. Son complementarios.
** ¿Puedo combinar RoboNet con conjuntos de datos modernos etiquetados con acción? ** Sí







