Volver a Blog

RoboMimic: Guía completa para el punto de referencia de aprendizaje de imitación de robots (2026)

RoboMimic explicó: conjuntos de datos, algoritmos BC/offline-RL, y el protocolo de evaluación estándar para la manipulación de robots <unk> más MimicGen para demostraciones sintéticas.

RoboMimic es el punto de referencia estándar para evaluar el aprendizaje de imitación y los algoritmos de RL fuera de línea en tareas de manipulación robótica. Si está desarrollando o evaluando un nuevo método de aprendizaje de políticas, sus resultados deben ser reportados contra RoboMimic. Esta guía cubre los conjuntos de datos, algoritmos, cómo ejecutar experimentos y cómo recopilar nuevos datos compatibles con RoboMimic utilizando hardware RCSV.

¿Qué es RoboMimic?

RoboMimic es un marco y referencia para el aprendizaje robótico a partir de demostraciones, desarrollado en la Universidad de Stanford por Ajay Mandlekar et al. y publicado en CoRL 2021. Proporciona tres cosas en un paquete: una colección curada de conjuntos de datos de demostración con calidad de operador variable, un conjunto de aprendizaje de imitación e implementaciones de algoritmos RL fuera de línea, y un protocolo de evaluación estandarizado que hace significativas las comparaciones entre papeles.

Antes de RoboMimic, comparar documentos de aprendizaje de imitación era difícil porque cada grupo recopilaba sus propios conjuntos de datos propietarios con diferentes operadores, diferentes estándares de calidad y diferentes protocolos de evaluación. Un documento que afirmaba una tasa de éxito del 80% podría estar utilizando demostraciones fáciles de expertos, mientras que otro que afirmaba que el 60% usó demostraciones desordenadas de principiantes los números no eran comparables. RoboMimic resolvió esto proporcionando un conjunto de datos públicos fijos en los que todos entrenan, haciendo que los números de referencia sean directamente comparables entre los documentos y las implementaciones.

RoboMimic utiliza el entorno de simulación [robosuite] (construido en MuJoCo) para la evaluación, lo que significa que puede reproducir resultados exactamente sin hardware físico aunque el marco también admite la transferencia de robots físicos. RCSV utiliza RoboMimic como el punto de referencia principal para evaluar el rendimiento del algoritmo antes de implementar políticas en el hardware físico.

Los conjuntos de datos de RoboMimic

RoboMimic incluye cuatro tareas, cada una con múltiples variantes de conjuntos de datos recopiladas de operadores de diferentes niveles de habilidad. Esta estructura de múltiples cualidades es la decisión de diseño más importante del punto de referencia: le permite probar cuán robusto es su algoritmo para la calidad del conjunto de datos, lo que importa enormemente en la práctica porque la recopilación de datos del mundo real produce demostraciones de calidad mixta.

Las tareas

Task Description Difficulty Demo Count
Lift Pick a small cube off a table and raise it above a height threshold Easy 200 per variant
Can Pick a soda can from a bin and place it in a designated target region Medium 200 per variant
Square Pick a square nut and fit it onto a peg — requires precise insertion alignment Hard 200 per variant
Transport Two-arm task: pick a hammer from a closed bin, transfer between arms, place in target bin Very Hard 200 per variant

Variantes del conjunto de datos

Cada tarea tiene cuatro variantes de conjunto de datos que reflejan diferentes niveles de consistencia del operador:

  • PH (Proficient-Human): Demonstraciones de un único operador altamente cualificado que completa con éxito cada ensayo con movimientos consistentes y suaves. Este es el conjunto de datos más fácil de aprender de baja varianza, alta calidad.
  • MH (Multihumano): Demostraciones de 6 operadores de diferentes niveles de habilidad: 1 operador "peor", 3 operadores "bien" y 2 operadores "mejor" (el humano competente de PH).
  • ** Subconjunto de MH:** Descargas separadas para los peores/bien/mejor subconjunto de MH, permitiendo estudiar cómo los filtros de calidad afectan el rendimiento.
  • RH (Rendered-Human): Demostraciones realizadas con observaciones de imágenes en lugar de observaciones basadas en el estado, para evaluar las políticas visuales.

Para la mayoría de los fines de investigación, el conjunto de datos MH es el punto de referencia más informativo porque prueba tanto la capacidad del algoritmo para filtrar demostraciones ruidosas como su capacidad para aprender de datos multimodal. Los algoritmos que obtienen un puntaje alto en PH pero mucho más bajo en MH tienen un problema de sobreajuste con datos limpios.

Formatos de archivos y descarga

Los conjuntos de datos RoboMimic se almacenan en formato HDF5 con un esquema estándar.

# HDF5 estructura de archivo para un solo archivo de demostración de RoboMimic elevación_ph__dim.hdf5 /data/ demo_0/ /obs/ robot0_eef_pos # (T, 3) posición del efecto final robot0_eef_quat # (T, 4) orientación del efecto final robot0_gripper_qpos # (T, 2) posición de la agarradora articulado objeto # (T, 14) poseo de objeto + otras acciones env obs /acciones # (T, 7) delta EEF pos + ori + agarrador / recompensas # (T,) por retorno de paso (sparse 1.0 en el episodio) /dones # (T (Tarradas de terminación banderas demo_1/ ... /mask/ tren # índices para tren dividido válidos # índices para la división de la división)

Descargar los conjuntos de datos del sitio web oficial de RoboMimic en T0. Los archivos van desde 50 MB (lift_ph_low_dim) hasta 14 GB (transport_mh_image). Las variantes de bajo tamaño (sólo las observaciones de estado) se entrenan mucho más rápido y son suficientes para el desarrollo de algoritmos; las variantes de imagen son necesarias para la evaluación visual de las políticas.

Algorithms: BC, BC-RNN, HBC e IRIS

RoboMimic implementa cuatro algoritmos como líneas de referencia. Entender lo que cada uno hace y cuándo cada uno trabaja es esencial antes de elegir cuál entrenar.

BC (clonación conductual)

La línea de base más simple: una política de MLP de retroalimentación que minimice el MSE entre las acciones previstas y demostradas. Observación: estado actual del robot (y/o imagen). Acción: pose del efecto final delta. No hay contexto temporal más allá del marco actual. BC se desempeña razonablemente en el levantamiento (tarea fácil, baja multimodalidad) pero se degrada significativamente en el Can y el Square porque no tiene memoria de la historia de trayectoria reciente y no puede manejar la variabilidad de demostración.

Cuando funciona: tareas con demostraciones de baja varianza, horizonte corto (apertura única), sin requisitos de coordinación en varios pasos.

Cuando falla: Cualquier tarea en la que el robot necesita recordar lo que acaba de hacer (común en tareas de varios pasos), o donde las demostraciones varían en estrategia.

BC-RNN (Cloning de comportamiento con redes recurrentes)

El LSTM mantiene un estado oculto a través de los pasos temporales, dando a la memoria temporal de la política. Esto mejora significativamente el rendimiento en tareas de múltiples pasos como Can y Transport, donde conocer la historia de los movimientos de los brazos es esencial para decidir qué hacer a continuación. BC-RNN con 2 capas LSTM (400 unidades ocultas por capa) es la línea de base estándar BC más fuerte y el número más comúnmente reportado en los documentos de aprendizaje de imitación.

Cuando funciona: tareas de varios pasos, tareas con dependencias temporales, tareas en las que el robot necesita recordar estados de contacto anteriores.

Cuando no funciona: Tarea con alta multimodalidad (múltiples estrategias válidas) el LSTM promedia entre estrategias en su estado oculto, lo que lleva a artefactos mediados de modo en el conjunto de datos MH.

HBC (clonación jerárquica del comportamiento)

Una política jerárquica de dos niveles: un "planificador" de alto nivel predice los estados de subobjetivos (por ejemplo, configuraciones intermedias del robot), y un "controlador" de bajo nivel aprende a alcanzar cada subobjetivos. La jerarquía proporciona una estructura inductiva que ayuda en tareas de largo horizonte. El HBC suele superar al BC-RNN en Transporte y Cuadrados (tareas de largo horizonte), pero requiere una sintonización más cuidadosa de los hiperparámetros, particularmente la longitud del horizonte subobjetivos.

IRIS (Representaciones implícitas para la imitación con subobjetivos)

IRIS extiende HBC con un mejor aprendizaje de la representación de subobjetivos. En lugar de predecir subobjetivos de estado del robot en bruto, IRIS aprende una representación latente de estados del espacio de trabajo que es más abstracta y más fácil para el planificador trabajar con. Utiliza un VAE para aprender el espacio latente de subobjetivos a partir de los datos de demostración. IRIS obtiene los resultados más sólidos de los cuatro algoritmos de referencia en el índice de referencia completo de RoboMimic, en particular en los conjuntos de datos MH (calidad humana mixta), donde su estructura subobjetivista proporciona robustez a la variabilidad de demostración.

Añadir algoritmos externos a RoboMimic

El marco de RoboMimic facilita la adición de su propio algoritmo como una nueva clase de "algo". El requisito clave de integración es la implementación de la interfaz T1 un método T2 que toma un dictado de observación estandarizado y devuelve una acción del efecto final delta. RCSV mantiene en nuestra plataforma interna envolturas RoboMimic tanto para la política de difusión como para ACT.

Cómo ejecutar experimentos de robo-mímica

# Instalar RoboMimic pip instalar robomimic # O desde la fuente para la última versión git clone T18 cd robomimic && pip instalar -e . # Instalar robosuite (entorno de simulación) pip instalar robosuite # Descargar un conjunto de datos (ejemplo: elevación, expertos humanos, observaciones de bajo tamaño) python robomimic/scripts/download_datasets.py \ --tasks lift \dataset_types \ --hdf5_types low_dim # Generar un entrenamiento python robomimic/scripts/generate__configs.py \ --algo bc_r_agent --elevación de tareas_tipo phimimim _type \ _type _robot \ \ \ \t\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r

El entrenamiento BC-RNN en elevación PH de baja profundidad toma aproximadamente 30 minutos en una sola RTX 3090. El entrenamiento en observaciones de imágenes toma 46 horas para la misma tarea.

Parámetros clave de configuración

Parameter Default Notes
train.num_epochs 2000 200 demos × 2000 epochs = ~400k gradient steps; sufficient for low-dim tasks
train.batch_size 100 Increase to 256 or 512 for image tasks if VRAM allows
algo.rnn.hidden_dim 400 For BC-RNN; larger values help on complex tasks but slow training
observation.encoder.core_kwargs.feature_dim 64 For image tasks; feature dimension from ResNet encoder
experiment.rollout.n 50 Number of evaluation rollouts — 50 is the standard; do not reduce below 20

Resultados de referencia

Las siguientes tasas de éxito son del documento original de RoboMimic (Mandlekar et al., 2021) más las actualizaciones posteriores de la comunidad.

Task / Split BC BC-RNN HBC IRIS
Lift PH (low-dim) 100% 100% 100% 100%
Lift MH (low-dim) 98% 100% 100% 100%
Can PH (low-dim) 92% 100% 100% 100%
Can MH (low-dim) 12% 48% 36% 74%
Square PH (low-dim) 70% 80% 100% 98%
Square MH (low-dim) 0% 2% 10% 50%
Transport PH (low-dim) 0% 22% 88% 98%
Transport MH (low-dim) 0% 6% 22% 58%

La comparación más instructiva es Can MH: BC cae del 92% (PH) al 12% (MH), mientras que IRIS cae solo del 100% al 74%. Esta brecha la "degradación de MH" es la señal de referencia clave. Un algoritmo que mantiene el rendimiento en MH está aprendiendo a filtrar demostraciones de baja calidad y manejar datos multimodal, que predice directamente el rendimiento en el mundo real donde no se puede garantizar la calidad del operador.

Compatibilidad con el hardware RCSV

Para la transferencia física de robots, RCSV admite la recopilación de datos en formato RoboMimic en el brazo [OpenArm Base]T9) y AgileX PiPER, ambos de los cuales utilizan el mismo espacio de acción del efecto final delta de 7-DOF como la implementación de referencia RoboMimic.

La brecha entre la física y la simulación en RoboMimic es bien comprendida: las políticas entrenadas en la transferencia de datos simulados de RoboMimic a robots físicos a aproximadamente el 6075% de su tasa de éxito de sim, dependiendo de la tarea. El enfoque del RCSV es utilizar experimentos de simulación de RoboMimic para la selección de algoritmos y búsqueda de hiperparámetros, luego recopilar demostraciones físicas para la política de implementación final.

Recopilar conjuntos de datos personalizados compatibles con la RoboMimic

Si desea comparar su algoritmo en una tarea personalizada (no una de las cuatro tareas predeterminadas), el marco de recopilación de datos de RoboMimic le permite crear nuevas tareas en robosuite y recopilar demostraciones a través de la teleoperación de la ratón espacial. El esquema HDF5 está documentado y también puede convertir demostraciones físicas de robots en formato RoboMimic.

El servicio de recogida de datos de RCSV (T10) admite la creación y la recogida de tareas personalizadas de RoboMimic. Hemos ejecutado tareas de referencia de RoboMimic personalizadas para clientes de laboratorio farmacéutico (manejo de líquidos de precisión, clasificación de muestras), clientes de ensamblaje de electrónica (inserción de conectores, manejo de PCB) y laboratorios académicos (escenarios de manipulación personalizada para el desarrollo de algoritmos). Los conjuntos de datos se entregan en formato HDF5 compatible con los scripts de entrenamiento de RoboMimic sin necesidad de conversión de formato.

El paquete de conjuntos de datos estándar de RCSV para una tarea RoboMimic personalizada incluye: 200 demostraciones de PH de un solo operador capacitado, 200 demostraciones de MH de 3 operadores de diferentes niveles de habilidad (para permitir el punto de referencia MH) y una definición de entorno robosuite personalizada que coincida con la geometría de su tarea física. El giro de la actividad es típicamente de 2 a 3 semanas. [Contacta con nosotros]

Lectura relacionada

  • [Guía de políticas de difusión]T12) El algoritmo que supera a IRIS en muchas tareas RoboMimic
  • [Política de ACT Explicada]T13) El algoritmo de ALOHA; puede ser comparado en RoboMimic con adaptadores
  • [Mejores robots para el aprendizaje de imitación]T14) Comparación de plataformas para hardware compatible con RoboMimic
  • [OpenArm Base]T15) Plataforma principal de RCSV para experimentos físicos RoboMimic
  • Servicios de datos del RCSV Colección de conjuntos de datos RoboMimic personalizados
  • Conoscimientos del RCSV Resultados de RoboMimic junto con evaluaciones personalizadas del RCSV