RoboMimic: Guía completa para el punto de referencia de aprendizaje de imitación de robots (2026)
RoboMimic explicó: conjuntos de datos, algoritmos BC/offline-RL, y el protocolo de evaluación estándar para la manipulación de robots <unk> más MimicGen para demostraciones sintéticas.
RoboMimic es el punto de referencia estándar para evaluar el aprendizaje de imitación y los algoritmos de RL fuera de línea en tareas de manipulación robótica. Si está desarrollando o evaluando un nuevo método de aprendizaje de políticas, sus resultados deben ser reportados contra RoboMimic. Esta guía cubre los conjuntos de datos, algoritmos, cómo ejecutar experimentos y cómo recopilar nuevos datos compatibles con RoboMimic utilizando hardware RCSV.
¿Qué es RoboMimic?
RoboMimic es un marco y referencia para el aprendizaje robótico a partir de demostraciones, desarrollado en la Universidad de Stanford por Ajay Mandlekar et al. y publicado en CoRL 2021. Proporciona tres cosas en un paquete: una colección curada de conjuntos de datos de demostración con calidad de operador variable, un conjunto de aprendizaje de imitación e implementaciones de algoritmos RL fuera de línea, y un protocolo de evaluación estandarizado que hace significativas las comparaciones entre papeles.
Antes de RoboMimic, comparar documentos de aprendizaje de imitación era difícil porque cada grupo recopilaba sus propios conjuntos de datos propietarios con diferentes operadores, diferentes estándares de calidad y diferentes protocolos de evaluación. Un documento que afirmaba una tasa de éxito del 80% podría estar utilizando demostraciones fáciles de expertos, mientras que otro que afirmaba que el 60% usó demostraciones desordenadas de principiantes
RoboMimic utiliza el entorno de simulación [robosuite] (construido en MuJoCo) para la evaluación, lo que significa que puede reproducir resultados exactamente sin hardware físico
Los conjuntos de datos de RoboMimic
RoboMimic incluye cuatro tareas, cada una con múltiples variantes de conjuntos de datos recopiladas de operadores de diferentes niveles de habilidad. Esta estructura de múltiples cualidades es la decisión de diseño más importante del punto de referencia: le permite probar cuán robusto es su algoritmo para la calidad del conjunto de datos, lo que importa enormemente en la práctica porque la recopilación de datos del mundo real produce demostraciones de calidad mixta.
Las tareas
| Task | Description | Difficulty | Demo Count |
|---|---|---|---|
| Lift | Pick a small cube off a table and raise it above a height threshold | Easy | 200 per variant |
| Can | Pick a soda can from a bin and place it in a designated target region | Medium | 200 per variant |
| Square | Pick a square nut and fit it onto a peg — requires precise insertion alignment | Hard | 200 per variant |
| Transport | Two-arm task: pick a hammer from a closed bin, transfer between arms, place in target bin | Very Hard | 200 per variant |
Variantes del conjunto de datos
Cada tarea tiene cuatro variantes de conjunto de datos que reflejan diferentes niveles de consistencia del operador:
- PH (Proficient-Human): Demonstraciones de un único operador altamente cualificado que completa con éxito cada ensayo con movimientos consistentes y suaves. Este es el conjunto de datos más fácil de aprender de
baja varianza, alta calidad. - MH (Multihumano): Demostraciones de 6 operadores de diferentes niveles de habilidad: 1 operador "peor", 3 operadores "bien" y 2 operadores "mejor" (el humano competente de PH).
- ** Subconjunto de MH:** Descargas separadas para los peores/bien/mejor subconjunto de MH, permitiendo estudiar cómo los filtros de calidad afectan el rendimiento.
- RH (Rendered-Human): Demostraciones realizadas con observaciones de imágenes en lugar de observaciones basadas en el estado, para evaluar las políticas visuales.
Para la mayoría de los fines de investigación, el conjunto de datos MH es el punto de referencia más informativo porque prueba tanto la capacidad del algoritmo para filtrar demostraciones ruidosas como su capacidad para aprender de datos multimodal. Los algoritmos que obtienen un puntaje alto en PH pero mucho más bajo en MH tienen un problema de sobreajuste con datos limpios.
Formatos de archivos y descarga
Los conjuntos de datos RoboMimic se almacenan en formato HDF5 con un esquema estándar.
# HDF5 estructura de archivo para un solo archivo de demostración de RoboMimic elevación_ph__dim.hdf5 /data/ demo_0/ /obs/ robot0_eef_pos # (T, 3) posición del efecto final robot0_eef_quat # (T, 4) orientación del efecto final robot0_gripper_qpos # (T, 2) posición de la agarradora articulado objeto # (T, 14) poseo de objeto + otras acciones env obs /acciones # (T, 7) delta EEF pos + ori + agarrador / recompensas # (T,) por retorno de paso (sparse 1.0 en el episodio) /dones # (T (Tarradas de terminación banderas demo_1/ ... /mask/ tren # índices para tren dividido válidos # índices para la división de la división)
Descargar los conjuntos de datos del sitio web oficial de RoboMimic en
Algorithms: BC, BC-RNN, HBC e IRIS
RoboMimic implementa cuatro algoritmos como líneas de referencia. Entender lo que cada uno hace y cuándo cada uno trabaja es esencial antes de elegir cuál entrenar.
BC (clonación conductual)
La línea de base más simple: una política de MLP de retroalimentación que minimice el MSE entre las acciones previstas y demostradas. Observación: estado actual del robot (y/o imagen). Acción: pose del efecto final delta. No hay contexto temporal más allá del marco actual. BC se desempeña razonablemente en el levantamiento (tarea fácil, baja multimodalidad) pero se degrada significativamente en el Can y el Square porque no tiene memoria de la historia de trayectoria reciente y no puede manejar la variabilidad de demostración.
Cuando funciona: tareas con demostraciones de baja varianza, horizonte corto (apertura única), sin requisitos de coordinación en varios pasos.
Cuando falla: Cualquier tarea en la que el robot necesita recordar lo que acaba de hacer (común en tareas de varios pasos), o donde las demostraciones varían en estrategia.
BC-RNN (Cloning de comportamiento con redes recurrentes)
El LSTM mantiene un estado oculto a través de los pasos temporales, dando a la memoria temporal de la política. Esto mejora significativamente el rendimiento en tareas de múltiples pasos como Can y Transport, donde conocer la historia de los movimientos de los brazos es esencial para decidir qué hacer a continuación. BC-RNN con 2 capas LSTM (400 unidades ocultas por capa) es la línea de base estándar BC más fuerte y el número más comúnmente reportado en los documentos de aprendizaje de imitación.
Cuando funciona: tareas de varios pasos, tareas con dependencias temporales, tareas en las que el robot necesita recordar estados de contacto anteriores.
Cuando no funciona: Tarea con alta multimodalidad (múltiples estrategias válidas)
HBC (clonación jerárquica del comportamiento)
Una política jerárquica de dos niveles: un "planificador" de alto nivel predice los estados de subobjetivos (por ejemplo, configuraciones intermedias del robot), y un "controlador" de bajo nivel aprende a alcanzar cada subobjetivos. La jerarquía proporciona una estructura inductiva que ayuda en tareas de largo horizonte. El HBC suele superar al BC-RNN en Transporte y Cuadrados (tareas de largo horizonte), pero requiere una sintonización más cuidadosa de los hiperparámetros, particularmente la longitud del horizonte subobjetivos.
IRIS (Representaciones implícitas para la imitación con subobjetivos)
IRIS extiende HBC con un mejor aprendizaje de la representación de subobjetivos. En lugar de predecir subobjetivos de estado del robot en bruto, IRIS aprende una representación latente de estados del espacio de trabajo que es más abstracta y más fácil para el planificador trabajar con. Utiliza un VAE para aprender el espacio latente de subobjetivos a partir de los datos de demostración. IRIS obtiene los resultados más sólidos de los cuatro algoritmos de referencia en el índice de referencia completo de RoboMimic, en particular en los conjuntos de datos MH (calidad humana mixta), donde su estructura subobjetivista proporciona robustez a la variabilidad de demostración.
Añadir algoritmos externos a RoboMimic
El marco de RoboMimic facilita la adición de su propio algoritmo como una nueva clase de "algo". El requisito clave de integración es la implementación de la interfaz
Cómo ejecutar experimentos de robo-mímica
# Instalar RoboMimic pip instalar robomimic # O desde la fuente para la última versión git clone
El entrenamiento BC-RNN en elevación PH de baja profundidad toma aproximadamente 30 minutos en una sola RTX 3090. El entrenamiento en observaciones de imágenes toma 4
Parámetros clave de configuración
| Parameter | Default | Notes |
|---|---|---|
train.num_epochs |
2000 | 200 demos × 2000 epochs = ~400k gradient steps; sufficient for low-dim tasks |
train.batch_size |
100 | Increase to 256 or 512 for image tasks if VRAM allows |
algo.rnn.hidden_dim |
400 | For BC-RNN; larger values help on complex tasks but slow training |
observation.encoder.core_kwargs.feature_dim |
64 | For image tasks; feature dimension from ResNet encoder |
experiment.rollout.n |
50 | Number of evaluation rollouts — 50 is the standard; do not reduce below 20 |
Resultados de referencia
Las siguientes tasas de éxito son del documento original de RoboMimic (Mandlekar et al., 2021) más las actualizaciones posteriores de la comunidad.
| Task / Split | BC | BC-RNN | HBC | IRIS |
|---|---|---|---|---|
| Lift PH (low-dim) | 100% | 100% | 100% | 100% |
| Lift MH (low-dim) | 98% | 100% | 100% | 100% |
| Can PH (low-dim) | 92% | 100% | 100% | 100% |
| Can MH (low-dim) | 12% | 48% | 36% | 74% |
| Square PH (low-dim) | 70% | 80% | 100% | 98% |
| Square MH (low-dim) | 0% | 2% | 10% | 50% |
| Transport PH (low-dim) | 0% | 22% | 88% | 98% |
| Transport MH (low-dim) | 0% | 6% | 22% | 58% |
La comparación más instructiva es Can MH: BC cae del 92% (PH) al 12% (MH), mientras que IRIS cae solo del 100% al 74%. Esta brecha
Compatibilidad con el hardware RCSV
Para la transferencia física de robots, RCSV admite la recopilación de datos en formato RoboMimic en el brazo [OpenArm Base]
La brecha entre la física y la simulación en RoboMimic es bien comprendida: las políticas entrenadas en la transferencia de datos simulados de RoboMimic a robots físicos a aproximadamente el 60
Recopilar conjuntos de datos personalizados compatibles con la RoboMimic
Si desea comparar su algoritmo en una tarea personalizada (no una de las cuatro tareas predeterminadas), el marco de recopilación de datos de RoboMimic le permite crear nuevas tareas en robosuite y recopilar demostraciones a través de la teleoperación de la ratón espacial. El esquema HDF5 está documentado y también puede convertir demostraciones físicas de robots en formato RoboMimic.
El servicio de recogida de datos de RCSV (
El paquete de conjuntos de datos estándar de RCSV para una tarea RoboMimic personalizada incluye: 200 demostraciones de PH de un solo operador capacitado, 200 demostraciones de MH de 3 operadores de diferentes niveles de habilidad (para permitir el punto de referencia MH) y una definición de entorno robosuite personalizada que coincida con la geometría de su tarea física. El giro de la actividad es típicamente de 2 a 3 semanas. [Contacta con nosotros]
Lectura relacionada
- [Guía de políticas de difusión]
T12 ) El algoritmo que supera a IRIS en muchas tareas RoboMimic - [Política de ACT Explicada]
T13 ) El algoritmo de ALOHA; puede ser comparado en RoboMimic con adaptadores - [Mejores robots para el aprendizaje de imitación]
T14 ) Comparación de plataformas para hardware compatible con RoboMimic - [OpenArm Base]
T15 ) Plataforma principal de RCSV para experimentos físicos RoboMimic - Servicios de datos del RCSV
Colección de conjuntos de datos RoboMimic personalizados - Conoscimientos del RCSV
Resultados de RoboMimic junto con evaluaciones personalizadas del RCSV







