Robomimic: punto de referencia para el aprendizaje de la imitación canónica
Explore Robomimic: 6 suites de tareas, 1000+ demos por tarea, basados en robosuite y MuJoCo. Descargue, reproduzca las líneas de base de BC-RNN y la Política de difusión, y haga referencia en 1 tarde.
Una guía para profesionales de Robomimic
TL;DR
| Metric | Value |
|---|---|
| Task suites | 6 (Lift, Can, Square, Transport, ToolHang, NutAssembly) |
| Robots | Franka Emika Panda, Rethink Sawyer (simulated in robosuite) |
| Modalities | Low-dim state, RGB (agent + wrist camera), object poses |
| License | MIT |
| Size | ~1,000 demonstrations per task × 3 data qualities (PH, MH, MG) |
| Simulator | robosuite (MuJoCo) |
¿Qué es Robomimic?
Robomimic fue introducido por la Iniciativa ARISE en Stanford (Ajay Mandlekar, Danfei Xu, Josiah Wong, et al.) como un estudio empírico riguroso de lo que realmente funciona en el aprendizaje de imitación para la manipulación de robots. El equipo recogió tres versiones de las demostraciones de cada tarea
El software que acompañaba el documento
Robomimic es también el antepasado intelectual directo de LIBERO
Cómo descargar y cargar
Robomimic envía un guión de descarga de una línea que recoge los archivos HDF5 canónicos del espejo de Stanford:
# Install the framework
pip install robomimic
# Download all task suites at PH, MH, and MG quality
python -m robomimic.scripts.download_datasets \
--tasks lift can square transport tool_hang nut_assembly \
--dataset_types ph mh mg \
--hdf5_types image low_dim
# Train a Diffusion Policy baseline
python -m robomimic.scripts.train \
--config configs/diffusion_policy.json \
--dataset datasets/square/ph/low_dim_v141.hdf5
# Evaluate the trained checkpoint in robosuite
python -m robomimic.scripts.run_trained_agent \
--agent trained_models/.../model_epoch_2000.pth \
--n_rollouts 50 --video_path eval.mp4
El formato HDF5 es auto-descriptivo
Casos de uso comunes y emparejamientos de modelos
- BC baselines. BC-RNN y BC-Transformer en Robomimic son las líneas de base canónicas que cada nuevo papel de imitación debe superar.
- Evaluación de la política de difusión. El documento de la política de difusión de Cheng Chi utilizó Robomimic como su punto de referencia principal, y cada documento de seguimiento mantiene la misma lista de tareas.
- Comparaciones de RL fuera de línea. La división MG (generada por máquina) es uno de los pocos conjuntos de datos de manipulación de robots reales diseñados específicamente para la investigación de RL fuera de línea.
- Curriculum sim-to-real. Debido a que las tareas se basan en MuJoCo, los equipos a menudo inician las políticas de Franka en robots reales en Robomimic Lift o Square antes de pasar a datos del mundo real.
Indicadores de referencia y tablas de clasificación
Robomimic tiene un promedio de más de 50 lanzamientos por tarea. La política de difusión informa 100% sobre el levantamiento y la lata, 95% + en el cuadrado y 80% + en el transporte y la herramientaHang de la división PH. Consulte los números de referencia en Papers with Code Robomimic entry, la página oficial del proyecto, y el Mandlekar et al. CoRL 2021 paper.
Inmersión técnica profunda: datos PH vs MH vs MG
La decisión de diseño más útil de Robomimic es que cada tarea se realiza en tres regímenes de calidad de datos. ** Proficient-Human (PH) ** es 200 demostraciones de un solo teleoperador experto que tenía una amplia práctica en la tarea. ** Mixed-Human (MH) ** es 300 demostraciones repartidas entre seis teleoperadores de habilidades variables, lo que introduce una heterogeneidad realista en la forma de trayectoria, la tasa de éxito y la vacilación. ** Machine-Generated (MG) ** es 300 implementaciones de un agente SAC subóptimo, utilizado específicamente para estudiar RL fuera de línea bajo supuestos de política de comportamiento subóptimo.
La línea empírica del documento de CoRL 2021 es que el BC-RNN en datos PH coincide o supera todos los métodos RL fuera de línea probados en cada tarea. En datos MH la brecha se estrecha, pero BC sigue ganando. Sólo en datos MG los métodos RL fuera de línea (específicamente CQL e IRIS) superan a BC, lo que se alinea con la expectativa teórica de que BC solo puede ser tan bueno como sus datos. Por esta razón, la política de difusión y los documentos de seguimiento casi siempre informan primero los números de PH y MH.
Otro detalle sutil pero importante es la división de observación
Las limitaciones conocidas
- Sólo simulación. Todos los datos son generados por MuJoCo. La transferencia de Sim a la realidad no es directamente compatible y requiere su propia receta de aleatorización.
- ** Pequeña cobertura por tarea.** 200-300 demostraciones por tarea es pequeña para los estándares modernos de VLA.
- No hay instrucciones lingüísticas. Las tareas se identifican por ID, no por lenguaje natural, por lo que Robomimic no puede entrenar directamente las políticas condicionadas por lenguaje.
- Sólo Franka / Sawyer. La transferencia de encarnaciones cruzados requiere combinarse con Open X-Embodiment o similares.
Las preguntas frecuentes
¿Robomimic se ha desactualizado ahora que existe LIBERO? No
** ¿Puedo utilizar Robomimic como un marco de entrenamiento sin utilizar los conjuntos de datos? ** Sí
** ¿Cuál es la forma más rápida de baseline de un nuevo algoritmo? ** Ejecutar BC-RNN y Política de difusión en datos de PH para las 6 tareas con las configuraciones enviadas. Eso toma ~ 2 días de GPU y le da un punto de comparación reproducible.







