Volver a Datasets

Robomimic: punto de referencia para el aprendizaje de la imitación canónica

Explore Robomimic: 6 suites de tareas, 1000+ demos por tarea, basados en robosuite y MuJoCo. Descargue, reproduzca las líneas de base de BC-RNN y la Política de difusión, y haga referencia en 1 tarde.

Una guía para profesionales de Robomimic el punto de referencia de la Iniciativa ARISE de seis tareas que se convirtió en el punto de referencia para las evaluaciones de BC-RNN, BC-Transformer y Política de difusión.

TL;DR

Metric Value
Task suites 6 (Lift, Can, Square, Transport, ToolHang, NutAssembly)
Robots Franka Emika Panda, Rethink Sawyer (simulated in robosuite)
Modalities Low-dim state, RGB (agent + wrist camera), object poses
License MIT
Size ~1,000 demonstrations per task × 3 data qualities (PH, MH, MG)
Simulator robosuite (MuJoCo)

¿Qué es Robomimic?

Robomimic fue introducido por la Iniciativa ARISE en Stanford (Ajay Mandlekar, Danfei Xu, Josiah Wong, et al.) como un estudio empírico riguroso de lo que realmente funciona en el aprendizaje de imitación para la manipulación de robots. El equipo recogió tres versiones de las demostraciones de cada tarea Proficient-Human (PH), Mixed-Human (MH) y Machine-Generated (MG) y luego realizó un barrido de algoritmo masivo (BC, BC-RNN, HBC, IRIS, BCQ, CQL y varias líneas de base de RL fuera de línea) en las 18 combinaciones resultantes (tarefa, calidad de datos). La contribución principal del documento fue mostrar que el BC (BC-RNN) con condición de historia es una línea de base notablemente fuerte y que la brecha entre el aprendizaje RL fuera de línea y el aprendizaje imitativo se desvanece cuando la calidad de los datos es alta.

El software que acompañaba el documento el paquete Python T1 se ha vuelto aún más influyente que el propio benchmark. Envía un formato de datos HDF5 limpio, un bucle de entrenamiento unificado, clases de algoritmos configurables y evaluación determinista en robosuite, que juntos lo convierten en la forma más rápida de reproducir cualquier documento de clonación conductual de los últimos cuatro años. La Política de difusión, ACT y BeT todos informan números robomimicos como su referencia canónica de datos bajos.

Robomimic es también el antepasado intelectual directo de LIBERO LIBERO mantiene el formato de escena robosuite y la convención HDF5, y los extiende con un plan de estudios de aprendizaje permanente.

Cómo descargar y cargar

Robomimic envía un guión de descarga de una línea que recoge los archivos HDF5 canónicos del espejo de Stanford:

# Install the framework
pip install robomimic

# Download all task suites at PH, MH, and MG quality
python -m robomimic.scripts.download_datasets \
  --tasks lift can square transport tool_hang nut_assembly \
  --dataset_types ph mh mg \
  --hdf5_types image low_dim

# Train a Diffusion Policy baseline
python -m robomimic.scripts.train \
  --config configs/diffusion_policy.json \
  --dataset datasets/square/ph/low_dim_v141.hdf5

# Evaluate the trained checkpoint in robosuite
python -m robomimic.scripts.run_trained_agent \
  --agent trained_models/.../model_epoch_2000.pth \
  --n_rollouts 50 --video_path eval.mp4

El formato HDF5 es auto-descriptivo cada trayectoria incluye observaciones, acciones, recompensas y posiciones de objetos para que pueda evitar el bucle de entrenamiento robomimic por completo y alimentar los episodios en su propio marco (LeRobot, Octo, difusores) con diez líneas de código de pegamento.

Casos de uso comunes y emparejamientos de modelos

  • BC baselines. BC-RNN y BC-Transformer en Robomimic son las líneas de base canónicas que cada nuevo papel de imitación debe superar.
  • Evaluación de la política de difusión. El documento de la política de difusión de Cheng Chi utilizó Robomimic como su punto de referencia principal, y cada documento de seguimiento mantiene la misma lista de tareas.
  • Comparaciones de RL fuera de línea. La división MG (generada por máquina) es uno de los pocos conjuntos de datos de manipulación de robots reales diseñados específicamente para la investigación de RL fuera de línea.
  • Curriculum sim-to-real. Debido a que las tareas se basan en MuJoCo, los equipos a menudo inician las políticas de Franka en robots reales en Robomimic Lift o Square antes de pasar a datos del mundo real.

Indicadores de referencia y tablas de clasificación

Robomimic tiene un promedio de más de 50 lanzamientos por tarea. La política de difusión informa 100% sobre el levantamiento y la lata, 95% + en el cuadrado y 80% + en el transporte y la herramientaHang de la división PH. Consulte los números de referencia en Papers with Code Robomimic entry, la página oficial del proyecto, y el Mandlekar et al. CoRL 2021 paper.

Inmersión técnica profunda: datos PH vs MH vs MG

La decisión de diseño más útil de Robomimic es que cada tarea se realiza en tres regímenes de calidad de datos. ** Proficient-Human (PH) ** es 200 demostraciones de un solo teleoperador experto que tenía una amplia práctica en la tarea. ** Mixed-Human (MH) ** es 300 demostraciones repartidas entre seis teleoperadores de habilidades variables, lo que introduce una heterogeneidad realista en la forma de trayectoria, la tasa de éxito y la vacilación. ** Machine-Generated (MG) ** es 300 implementaciones de un agente SAC subóptimo, utilizado específicamente para estudiar RL fuera de línea bajo supuestos de política de comportamiento subóptimo.

La línea empírica del documento de CoRL 2021 es que el BC-RNN en datos PH coincide o supera todos los métodos RL fuera de línea probados en cada tarea. En datos MH la brecha se estrecha, pero BC sigue ganando. Sólo en datos MG los métodos RL fuera de línea (específicamente CQL e IRIS) superan a BC, lo que se alinea con la expectativa teórica de que BC solo puede ser tan bueno como sus datos. Por esta razón, la política de difusión y los documentos de seguimiento casi siempre informan primero los números de PH y MH.

Otro detalle sutil pero importante es la división de observación T2 vs T3. Las observaciones de bajo tono incluyen poses de objetos de la verdad de la tierra, lo que los hace mucho más fáciles de aprender que los píxeles. Siempre informe ambos números un método que solo funciona con información privilegiada del estado no está listo para el despliegue real.

Las limitaciones conocidas

  • Sólo simulación. Todos los datos son generados por MuJoCo. La transferencia de Sim a la realidad no es directamente compatible y requiere su propia receta de aleatorización.
  • ** Pequeña cobertura por tarea.** 200-300 demostraciones por tarea es pequeña para los estándares modernos de VLA.
  • No hay instrucciones lingüísticas. Las tareas se identifican por ID, no por lenguaje natural, por lo que Robomimic no puede entrenar directamente las políticas condicionadas por lenguaje.
  • Sólo Franka / Sawyer. La transferencia de encarnaciones cruzados requiere combinarse con Open X-Embodiment o similares.

Las preguntas frecuentes

¿Robomimic se ha desactualizado ahora que existe LIBERO? No Robomimic sigue siendo el índice de referencia BC de tarea única más limpio.

** ¿Puedo utilizar Robomimic como un marco de entrenamiento sin utilizar los conjuntos de datos? ** Sí el paquete T4 Python se utiliza ampliamente como un ciclo de entrenamiento BC de uso general en la parte superior de los datos personalizados.

** ¿Cuál es la forma más rápida de baseline de un nuevo algoritmo? ** Ejecutar BC-RNN y Política de difusión en datos de PH para las 6 tareas con las configuraciones enviadas. Eso toma ~ 2 días de GPU y le da un punto de comparación reproducible.