Volver a Learn

Aprendizaje por imitación para robots: desde la clonación de comportamiento hasta las políticas de difusión

Una clara introducción al aprendizaje por imitación <unk> clonación de comportamiento, cambio de distribución, DAgger, acción de fragmentación y políticas de difusión explicadas.

[← Aprender]

Aprenda cómo los robots adquieren habilidades de las demostraciones humanas, por qué la imitación ingenua falla y cómo los algoritmos modernos superan sus desafíos fundamentales.

¿Qué es aprender por imitación?

El aprendizaje por imitación (IL) es una familia de algoritmos que enseñan a un robot a actuar aprendiendo de demostraciones expertas sin función de recompensa requerida.

El atractivo de la IL es práctico: es mucho más fácil para un humano mostrarle a un robot lo que debe hacer que diseñar manualmente una función de recompensa o escribir primitivas de movimiento.

Cloning de comportamiento: el punto de partida

El clonamiento de comportamiento (BC) es el algoritmo de IL más simple. Trata el problema como aprendizaje supervisado: dado el estado T5, predice la acción T6. Entrena una red neuronal minimizando el error cuadrado medio entre las acciones previstas y las de expertos en todos los pasos de tiempo de la demostración.

BC es rápido de entrenar, fácil de implementar y funciona sorprendentemente bien para tareas de horizonte corto.

La limitación crítica: errores de composición. Durante el entrenamiento, la red sólo ve estados que aparecen en las demostraciones. En el tiempo de prueba, incluso un pequeño error de predicción mueve al robot a un estado ligeramente diferente que nunca ha visto. La siguiente predicción es entonces menos precisa, el error crece, y en unos segundos el robot se encuentra en un estado completamente fuera de distribución del que no puede recuperarse.

El problema de los cambios de distribución

El cambio de distribución es el reto principal en el aprendizaje de imitación. La distribución de entrenamiento T7 (estados observados durante las demostraciones) y la distribución de pruebas T8 (estados visitados por la política aprendida) son diferentes. Debido a que BC minimiza los errores en la distribución de entrenamiento, no da garantías sobre el comportamiento en la distribución de pruebas.

La visión matemática: para una política con error por paso T9 en un horizonte de T10 pasos, el error total esperado crece como T11. Doblar la longitud de la tarea cuadruplica el error de composición. Esta es la razón por la cual BC funciona para tareas de 5 segundos pero falla en tareas de 30 segundos sin manejo especial.

DAgger: fijación de la distribución

La agregación de conjuntos de datos (DAgger) aborda el cambio de distribución de forma iterativa:

  • ** Paso 1:** Elaborar una política inicial de la BC sobre las demostraciones originales.
  • ** Paso 2:** Implemente la política aprendida en el entorno real.
  • ** Paso 3:** Que un experto humano proporcione las acciones correctas en cada estado que la política visite incluso los malos que alcanzó por error.
  • ** Paso 4: ** Añadir estos pares (estado, acción corregida) al conjunto de datos.
  • ** Paso 5: ** Reentrenar la política del conjunto de datos agregados.

Después de varias rondas, la distribución de la formación coincide estrechamente con los estados que la política visita realmente, y el error de composición se reduce drásticamente.

Algoritmos modernos: ACT, Política de difusión y IBC

Tres algoritmos dominan el estado actual del arte en el aprendizaje de imitación de robots.

  • ACT Acción de Chunking con Transformers: En lugar de predecir una sola acción en cada paso, ACT predice una chunk de T12 acciones futuras a la vez (típicamente K=100 a 50Hz, por lo que 2 segundos de movimiento). El robot ejecuta la pieza, luego vuelve a planificar. Esto rompe el ciclo de error compuesto errores sólo se acumulan dentro de una pieza, no a través de todo el episodio. ACT utiliza un codificador CVAE para manejar datos de demostración multimodal y un decodificador Transformer para generar secuencias de acción.
  • ** Política de difusión:** Modela la distribución de la acción como un proceso de difusión denociante. En lugar de predecir una sola acción, la política de difusión aprende a denotar iteracionalmente el ruido aleatorio en una trayectoria de acción plausible. Esto maneja naturalmente los casos de multi-modalidad donde existen múltiples acciones válidas para un estado dado (por ejemplo, agarrar desde la izquierda o la derecha). Una sola red de BC promediaría estas soluciones y predijo algo inválido; la Política de difusión puede representar ambos modos.
  • IBC Cloning de comportamiento implícito: Entrena una función energética T13 en lugar de un predictor de acción directa. Inferencia encuentra la acción que minimiza la energía a través del descenso de gradientes o muestreo MCMC.

Comparación de algoritmos

Algorithm Handles Multi-Modal Action Horizon Training Speed Inference Speed Best For
Behavior Cloning No (averages modes) Single step Very fast Very fast Short tasks, simple grasps
DAgger No Single step Fast per iter Very fast Tasks where expert can correct live
ACT Partial (CVAE) Chunk (K steps) Fast Fast Bimanual, contact-rich tasks
Diffusion Policy Yes Horizon (T steps) Slow Moderate Complex, multi-modal tasks
IBC Yes Single step Moderate Slow Research; multi-modal with energy landscape

Para los profesionales que empiezan: comience con BC para validar su pipeline de datos y configuración de hardware. Pasen a ACT o Política de difusión una vez que necesiten abordar tareas de horizonte más largo o ricas en contactos. La elección entre ACT y Política de difusión depende más de su estructura de tareas que de su rendimiento en bruto.