Aprendizaje por imitación para robots: desde la clonación de comportamiento hasta las políticas de difusión
Una clara introducción al aprendizaje por imitación <unk> clonación de comportamiento, cambio de distribución, DAgger, acción de fragmentación y políticas de difusión explicadas.
[← Aprender]
Aprenda cómo los robots adquieren habilidades de las demostraciones humanas, por qué la imitación ingenua falla y cómo los algoritmos modernos superan sus desafíos fundamentales.
¿Qué es aprender por imitación?
El aprendizaje por imitación (IL) es una familia de algoritmos que enseñan a un robot a actuar aprendiendo de demostraciones expertas
El atractivo de la IL es práctico: es mucho más fácil para un humano mostrarle a un robot lo que debe hacer que diseñar manualmente una función de recompensa o escribir primitivas de movimiento.
Cloning de comportamiento: el punto de partida
El clonamiento de comportamiento (BC) es el algoritmo de IL más simple. Trata el problema como aprendizaje supervisado: dado el estado
BC es rápido de entrenar, fácil de implementar y funciona sorprendentemente bien para tareas de horizonte corto.
La limitación crítica: errores de composición. Durante el entrenamiento, la red sólo ve estados que aparecen en las demostraciones. En el tiempo de prueba, incluso un pequeño error de predicción mueve al robot a un estado ligeramente diferente
El problema de los cambios de distribución
El cambio de distribución es el reto principal en el aprendizaje de imitación. La distribución de entrenamiento
La visión matemática: para una política con error por paso
DAgger: fijación de la distribución
La agregación de conjuntos de datos (DAgger) aborda el cambio de distribución de forma iterativa:
- ** Paso 1:** Elaborar una política inicial de la BC sobre las demostraciones originales.
- ** Paso 2:** Implemente la política aprendida en el entorno real.
- ** Paso 3:** Que un experto humano proporcione las acciones correctas en cada estado que la política visite
incluso los malos que alcanzó por error. - ** Paso 4: ** Añadir estos pares (estado, acción corregida) al conjunto de datos.
- ** Paso 5: ** Reentrenar la política del conjunto de datos agregados.
Después de varias rondas, la distribución de la formación coincide estrechamente con los estados que la política visita realmente, y el error de composición se reduce drásticamente.
Algoritmos modernos: ACT, Política de difusión y IBC
Tres algoritmos dominan el estado actual del arte en el aprendizaje de imitación de robots.
- ACT
Acción de Chunking con Transformers: En lugar de predecir una sola acción en cada paso, ACT predice una chunk deT12 acciones futuras a la vez (típicamente K=100 a 50Hz, por lo que 2 segundos de movimiento). El robot ejecuta la pieza, luego vuelve a planificar. Esto rompe el ciclo de error compuesto errores sólo se acumulan dentro de una pieza, no a través de todo el episodio. ACT utiliza un codificador CVAE para manejar datos de demostración multimodal y un decodificador Transformer para generar secuencias de acción. - ** Política de difusión:** Modela la distribución de la acción como un proceso de difusión denociante. En lugar de predecir una sola acción, la política de difusión aprende a denotar iteracionalmente el ruido aleatorio en una trayectoria de acción plausible. Esto maneja naturalmente los casos de multi-modalidad
donde existen múltiples acciones válidas para un estado dado (por ejemplo, agarrar desde la izquierda o la derecha). Una sola red de BC promediaría estas soluciones y predijo algo inválido; la Política de difusión puede representar ambos modos. - IBC
Cloning de comportamiento implícito: Entrena una función energéticaT13 en lugar de un predictor de acción directa. Inferencia encuentra la acción que minimiza la energía a través del descenso de gradientes o muestreo MCMC.
Comparación de algoritmos
| Algorithm | Handles Multi-Modal | Action Horizon | Training Speed | Inference Speed | Best For |
|---|---|---|---|---|---|
| Behavior Cloning | No (averages modes) | Single step | Very fast | Very fast | Short tasks, simple grasps |
| DAgger | No | Single step | Fast per iter | Very fast | Tasks where expert can correct live |
| ACT | Partial (CVAE) | Chunk (K steps) | Fast | Fast | Bimanual, contact-rich tasks |
| Diffusion Policy | Yes | Horizon (T steps) | Slow | Moderate | Complex, multi-modal tasks |
| IBC | Yes | Single step | Moderate | Slow | Research; multi-modal with energy landscape |
Para los profesionales que empiezan: comience con BC para validar su pipeline de datos y configuración de hardware. Pasen a ACT o Política de difusión una vez que necesiten abordar tareas de horizonte más largo o ricas en contactos. La elección entre ACT y Política de difusión depende más de su estructura de tareas que de su rendimiento en bruto.







