Aprendizaje por imitación para robots: una guía práctica
Una guía práctica para el aprendizaje de imitación para robots: qué es, cómo ACT, la política de difusión y los VLA se comparan, los requisitos de datos, el hardware y cómo RCSV apoya su investigación de IL.
Parte de: [Guía de aprendizaje por imitación]
El aprendizaje por imitación ha surgido como el paradigma dominante para enseñar a los robots habilidades de manipulación hábiles. En lugar de crear funciones de recompensa a mano o escribir planes de movimiento, simplemente le muestras al robot qué hacer. Esta guía explica cómo funciona, qué algoritmos usar y qué infraestructura necesitas para obtener resultados.
¿Qué es aprender por imitación?
El aprendizaje por imitación (IL) - también llamado aprendizaje por demostración (LfD) o clonación conductual - entrena una política para replicar acciones capturadas de un operador humano. Durante la recopilación de datos, un demostrador experto teleopera al robot a través de la tarea objetivo mientras que los sensores registran posiciones conjuntas, poses de efectores finales, marcos de cámaras y cualquier otro estado relevante. Estos datos registrados se convierten en el conjunto de capacitación para una política de redes neuronales.
El atractivo de la IL sobre el aprendizaje de refuerzo es práctico: no es necesario diseñar una señal de recompensa, ejecutar millones de implementaciones simuladas o resolver un problema de exploración de recompensas escasas. El desafío es la generalización - las políticas entrenadas en demostraciones estrechas pueden fallar cuando las posiciones de los objetos, la iluminación o las variaciones de tareas difieren de la distribución de la formación.
La investigación moderna de IL aborda esto a través de mejores arquitecturas, conjuntos de datos más grandes y diversos y representaciones visuales pre-entrenadas. El campo ha avanzado rápidamente desde 2023, y el aprendizaje de imitación de calidad de producción está ahora al alcance de equipos sin acceso a un programa de doctorado en robótica.
Taxonomía de algoritmos de IL: BC, DAgger y HG-DAgger
**Cloning conductual (BC) ** es la forma más simple de aprendizaje de imitación. Recopilar un conjunto de datos estático de pares (observación, acción) de demostraciones, luego entrenar una red neuronal para predecir acciones de observaciones a través del aprendizaje supervisado. BC es fácil de implementar, rápido de entrenar y no requiere interacción en línea. Su debilidad fundamental es el error de composición: en el despliegue, pequeños errores de predicción alejan la distribución de las observaciones de los datos de formación, y las predicciones posteriores se degradan aún más porque la política se extrapola a estados que nunca vio durante la formación.
El problema de error de composición se escala con la longitud de la trayectoria. Para una tasa de error por paso de epsilon, el error total esperado en los pasos T crece como O(epsilon * T^2) bajo el análisis de peores casos de Ross and Bagnell (2010). En la práctica, esto significa que BC funciona bien para tareas cortas (menos de 30 pasos en la frecuencia de control) pero se degrada rápidamente en horizontes más largos sin estrategias de mitigación como el desbordamiento de acción.
**DAgger (agregación de Datasets) ** aborda el error de composición a través de la recopilación de datos en línea. Después de una fase inicial de BC, se implementa la política aprendida y un experto etiqueta las acciones que deberían haber sido tomadas en los estados que la política visitó realmente. Estos nuevos datos se agregan al conjunto de capacitación y se retrenió la política. Iterar este proceso probablemente converge a una política que funciona tan bien como el experto en el límite. El costo práctico es que DAgger requiere acceso repetido a un experto durante la formación - el experto debe ver la política ejecutada y corregir sus errores en tiempo real.
**HG-DAgger (Human-Gated DAgger) ** es una variante más práctica para el aprendizaje de robots. En lugar de requerir que un experto etiquete cada estado visitado, HG-DAgger permite que el humano interviene solo cuando la política está a punto de fallar. El operador observa al robot ejecutar la política aprendida y toma el control cuando sea necesario. Las trayectorias de intervención (que representan demostraciones correctivas de los estados de falla específicos de los encuentros de política) se añaden al conjunto de datos.
Para la mayoría de los proyectos prácticos de aprendizaje de robots en RCSV, recomendamos comenzar con BC utilizando el chunking de acción (que reduce drásticamente el error de composición) y graduarse a HG-DAgger solo si la política tiene modos de falla persistentes que los datos adicionales de BC no resuelven.
Leyes de escala de tamaño de conjunto de datos para el aprendizaje de imitación
¿Cuántas demostraciones realmente necesitas? La respuesta depende de la complejidad de la tarea, el algoritmo y la cantidad de generalización que necesitas. Basado en los resultados publicados y los datos de evaluación interna de RCSV, aquí están los comportamientos empíricos de escala:
| Dataset Size | Typical Result (single task, ACT) | When to Stop Adding Data |
|---|---|---|
| 10-25 demos | 20-40% success; policy captures gross motion but misses details | Never -- this is only useful for sanity checks |
| 50-100 demos | 60-80% success on in-distribution objects/positions | Acceptable for a research prototype with fixed conditions |
| 200-500 demos | 80-92% success; handles moderate position/object variation | Sufficient for most single-task deployments |
| 500-2000 demos | 88-95% success; robust to diverse objects, positions, lighting | Diminishing returns unless adding diversity, not volume |
Una visión crítica de [investigación de las leyes de escalado] ((
Las opciones de representación estatal
El espacio de observación que se alimenta a su política afecta significativamente a la eficiencia y generalización del aprendizaje.
Ángulos conjuntos + imágenes (por defecto recomendado). La observación en cada paso de tiempo es el vector de las posiciones de las articulaciones del robot (7 dimensiones para un brazo de 7 DOF, más 1 para el agarre) concatena con una o más imágenes de cámara (normalmente 224x224 o 256x256 RGB). Las imágenes proporcionan el contexto visual necesario para identificar objetos y diseño del espacio de trabajo. Este es el formato de entrada estándar para ACT, Política de difusión y la mayoría de los modelos VLA.
Posición de efecto final + imágenes. En lugar de ángulos conjuntos, la observación incluye la posición del efecto final (x, y, z) y la orientación (cuaternion o matriz de rotación) en el marco base del robot. Funciona bien cuando la política solo necesita controlar el movimiento del efecto final (en lugar de configuraciones conjuntas específicas).
** Únicamente ángulos conjuntos (sin imágenes).** Para las tareas de entorno fijo con posiciones de objetos conocidas (por ejemplo, montaje en fábrica con piezas fijas), las políticas propiocetivas puras entrenadas solo en ángulos conjuntos pueden lograr altas tasas de éxito con muy pocas demostraciones (todo menos de 20-50). Este enfoque es rápido de entrenar, fácil de implementar y muy fiable, pero no generaliza a ningún cambio visual.
Diseño del espacio de acción: Absoluto vs. Delta
La forma en que las acciones son representadas es más importante de lo que la mayoría de los practicantes se dan cuenta.
Posiciones conjuntas absolutas. Cada acción es el vector de ángulo conjunto objetivo para el siguiente paso temporal. La ventaja: las acciones son interpretables y están limitadas por límites conjuntos. La desventaja: la política debe aprender el mapeo completo de las observaciones a los objetivos conjuntos absolutos, y los pequeños cambios de observación pueden requerir grandes cambios de acción (ya que el objetivo absoluto puede estar lejos de la posición actual). ACT utiliza objetivos conjuntos absolutos por defecto.
**Acciones delta (relativas) *** Cada acción es el cambio en los ángulos conjuntos o en la pose de los efectores finales en relación con el estado actual. La desventaja: las acciones delta pueden acumularse a la deriva en trayectorias largas si no hay una corrección de referencia absoluta.
Recomendación práctica: para tareas menores a 100 pasos a un control de 10-20 Hz, las acciones del efecto final delta con puntos de referencia absolutos ocasionales proporcionan la mejor combinación de generalización y precisión.
ACT: Acción con transformadores
ACT, introducido junto con la plataforma de robots ALOHA bimanual de Stanford, trata el control de robots como un problema de predicción de secuencias. La política predice una gran cantidad de acciones futuras, típicamente 50-100 pasos en el tiempo, en lugar de una sola acción siguiente. Este choque de acción reduce el error de composición, que es el principal modo de fracaso de la clonación conductual ingenua donde se acumulan pequeños errores de predicción en una trayectoria.
ACT utiliza un CVAE (Conditional Variational Codificador Automático) durante el entrenamiento para capturar la multimodalidad de las demostraciones humanas, el hecho de que a menudo hay más de una forma correcta de completar una tarea. El resultado es una política que maneja la variación natural en las tareas demostradas por el hombre sin artefactos de mediación de modo.
Detalles clave de implementación que afectan al rendimiento: el peso de divergencia KL en la pérdida CVAE controla el compromiso entre la precisión de reconstrucción y la regularización del espacio latente. Comience con un peso de 10 y barrida [1, 5, 10, 50]. La técnica del conjunto temporal - promediando trozos de acción superpuestos con ponderación exponencial - suaviza las transiciones entre trozos y reduce el nerviosismo. Utilice un peso exponencial de 0.01 para el conjunto temporal.
ACT es un punto de partida fuerte para las tareas de manipulación bimanual. Requiere volúmenes de datos relativamente modestos (50-200 demostraciones por tarea) y se entrena en una sola GPU en 2-4 horas. Si está trabajando con hardware ALOHA o una configuración bimanual similar, ACT debería ser su primer algoritmo para probar. Los [servicios de datos] de RCSV ((
Política de difusión: manejo de las distribuciones de acción multimodal
La política de difusión aplica modelos de difusión de puntuación - la misma clase de modelos que impulsa la difusión estable para imágenes - al espacio de acción del robot. En lugar de predecir una sola acción mejor, la política aprende la distribución completa de las acciones que un demostrador humano podría tomar. En el momento de la inferencia ejecuta un proceso de desinfección para muestrar una acción de alta calidad de esa distribución.
La ventaja clave sobre ACT es la forma en que maneja las tareas multimodal: escenarios en los que un humano podría agarrar un objeto desde la izquierda o la derecha, o acercarse a un objetivo desde múltiples ángulos válidos. Muestras de política de difusión en el modo correcto dado el contexto actual, produciendo un comportamiento más robusto en tareas ambigüas.
La diferencia es la velocidad de inferencia. La política de difusión con una columna vertebral UNet requiere 100 pasos de denociamiento en inferencia por defecto (DDPM), que toma aproximadamente 500 ms en un RTX 3090 - demasiado lento para el control en tiempo real. El muestreo DDIM reduce esto a 10 pasos (~200 ms), y las variantes de destilación de consistencia logran la generación de un solo paso (~50 ms), haciendo viable la operación en tiempo real. Para obtener una comparación detallada del tiempo de la inferencia y cuándo utilizar cada variante, consulte nuestra guía de decisión sobre ACT vs. Política de difusión.
La política de difusión generalmente se beneficia de más demostraciones que ACT, pero recompensa la diversidad de los conjuntos de datos más que la cantidad bruta.
Modelos de acción de la visión-lenguaje: IL a escala
Las VLA como OpenVLA, pi0 y RT-2 amplían el aprendizaje de imitación mediante el pre-entrenamiento en datos visuales y de lenguaje a escala de Internet antes de ajustarlos a las demostraciones de robots. El ajuste fino requiere mucho menos demostraciones que entrenamiento desde cero, a veces tan pocos como 10 a 50 ejemplos específicos de tareas.
Los compromisos prácticos para entender: los VLA requieren mucho más computación tanto para el entrenamiento como para la inferencia. OpenVLA (7B parámetros) requiere una GPU A100 o H100 para el ajuste fino y ejecuta inferencia a aproximadamente 3 Hz, adecuada para la manipulación lenta pero no para tareas reactivas. Para los equipos que pueden pagar los requisitos de computación y licencia, los VLA representan la frontera actual del rendimiento de IL. Se generalizan mejor a nuevos objetos, nuevos entornos y variaciones de tareas específicas del idioma.
RCSV proporciona conjuntos de datos de ajuste fino y [infraestructura de teleoperación]
Más allá de BC: GAIL, IBC y RL inversa
Mientras que la clonación conductual y DAgger dominan el robot IL práctico, varios otros métodos merecen atención para escenarios específicos.
GAIL (Generative Adversarial Aprendizaje por Imitación). GAIL capacita a un discriminador para distinguir entre las demostraciones de expertos y las implementaciones de la política aprendida, luego utiliza la salida del discriminador como señal de recompensa para el aprendizaje de refuerzo. El resultado es una política que coincide con la distribución de la acción del experto en lugar de las acciones individuales, lo que proporciona una mejor generalización que BC cuando el conjunto de datos de demostración es pequeño (menos de 50 episodios). Caso de uso práctico: tareas en las que hay muy pocas demostraciones (10-20) pero el acceso a un buen simulador (por ejemplo, inserción de peg, donde MuJoCo modela la física con precisión).
** IBC (Cloning de comportamiento implícito).** IBC representa la política como un modelo basado en energía (EBM) en lugar de un predictor de acción explícito. En lugar de producir una sola acción, el modelo asigna una puntuación de energía a cada par candidato (observación, acción). La ventaja: IBC maneja naturalmente las distribuciones de acción multimodal sin la complejidad arquitectónica de los modelos de difusión o CVAE. La desventaja: la inferencia es lenta (100-500ms por paso en un RTX 3090) porque requiere optimización iterativa en cada paso de tiempo. El IBC ha demostrado resultados sólidos en tareas precisas y ricas en contacto (inserción, montaje) donde la distribución de la acción tiene modos agudos y bien separados.
RL inversa (IRL). En lugar de aprender acciones directamente, IRL recupera la función de recompensa que el experto estaba optimizando implícitamente, luego entrena una política a través de RL utilizando esa recompensa recuperada. La barrera práctica: IRL requiere entrenamiento repetido en un bucle interno, que es computacionalmente caro y requiere un simulador o una extensa interacción en el mundo real. IRL es más práctico para tareas de conducción autónoma y navegación donde la simulación es madura y la especificación de la recompensa es realmente difícil. Para la manipulación, BC con arquitecturas modernas es típicamente suficiente.
Marco de análisis de fallas para las políticas de IL
Cuando una política entrenada falla en el robot real, el análisis sistemático de fallas ahorra días de prueba y error.
** Paso 1: Clasifique el modo de falla.** Observe más de 10 episodios de falla y clasifique cada uno en uno de estos tipos:
- fallo de aproximación: El robot no se mueve hacia el objeto correctamente (dirección incorrecta, demasiado rápido/lento, se detiene corto).
- Grasp failure: El robot llega al objeto pero no puede agarrarlo (dedo mal alineado, fuerza insuficiente, ángulo equivocado).
- fallo de transporte: El robot agarra con éxito pero deja caer el objeto durante el transporte (desaceleración de la agarre, colisión con obstáculos).
- fallo de colocación: El robot transporta con éxito pero falla en la colocación final (orientación errónea, sobreposición).
- Falla de recuperación: El robot entra en un estado fuera de trayectoria (por ejemplo, después de un agarre parcial) y no puede recuperarse.
** Paso 2: Compruebe si hay problemas de calibración y hardware.** Antes de culpar a la política, compruebe que las cámaras están en sus posiciones calibradas (medida con una regla contra las marcas de referencia), que los codificadores conjuntos no se mueven (comandan el brazo a una posición conocida y compruebe visualmente), y que el agarre se está cerrando al ancho esperado. Los problemas de hardware que se disfrazan de fallas de política son una fuente común de tiempo de depuración perdido.
** Paso 3: Compare las observaciones de fallas con la distribución de entrenamiento.** Extraer el marco de la cámara en el momento de la falla y compararlo visualmente con los datos de entrenamiento. ¿Está el objeto en una posición que la política nunca ha visto? ¿Es la iluminación drásticamente diferente? ¿Hay un objeto oclusivo no presente durante el entrenamiento?
** Paso 4: Compruebe la media de modo.** Si el robot se mueve hacia un punto entre dos objetivos válidos (por ejemplo, entre dos objetos cuando debe elegir uno), la política se está promediando sobre los modos en los datos de demostración.
** Paso 5: Error de acción de trama por paso.** Si la política comienza bien pero se degrada después de 20-40 pasos, el problema principal es el error de composición. Aumente el tamaño de la pieza de acción, agregue ensamblaje temporal o recopile datos de HG-DAgger de los estados de falla específicos.
Esnípete de entrenamiento de Python: ACT con LeRobot
Aquí hay un guión de entrenamiento de trabajo mínimo para ACT utilizando el marco de Hugging Face LeRobot, anotado con las decisiones clave de configuración.
# train_act.py -- Minimal ACT training with LeRobot
from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
from lerobot.common.policies.act.modeling_act import ACTPolicy
from lerobot.common.policies.act.configuration_act import ACTConfig
import torch
# 1. Load dataset (HDF5 format, collected via LeRobot record)
dataset = LeRobotDataset("svrc/openarm-pick-place-v1")
print(f"Episodes: {dataset.num_episodes}, Steps: {len(dataset)}")
# 2. Configure ACT policy
config = ACTConfig(
chunk_size=100, # Predict 100 future actions per step
kl_weight=10.0, # CVAE KL divergence weight; sweep [1, 5, 10, 50]
dim_model=512, # Transformer hidden dimension
n_heads=8, # Multi-head attention heads
n_encoder_layers=4, # Visual encoder depth
n_decoder_layers=7, # Action decoder depth
input_shapes={
"observation.images.top": [3, 480, 640],
"observation.state": [14], # 7 joints x 2 arms (bimanual)
},
output_shapes={
"action": [14], # Joint position targets
},
)
# 3. Train
policy = ACTConfig(config)
optimizer = torch.optim.AdamW(policy.parameters(), lr=1e-5, weight_decay=1e-4)
for epoch in range(2000):
for batch in torch.utils.data.DataLoader(dataset, batch_size=8, shuffle=True):
loss = policy.forward(batch) # Returns dict with "loss" key
loss["loss"].backward()
optimizer.step()
optimizer.zero_grad()
if epoch % 100 == 0:
print(f"Epoch {epoch}: loss={loss['loss'].item():.4f}")
# 4. Export for deployment
policy.save_pretrained("checkpoints/act-pick-place-v1")
Este script asume que ha recopilado datos utilizando el comando
Problemas y soluciones comunes de calidad de los datos
| Symptom | Likely Cause | Fix |
|---|---|---|
| Policy jerky, oscillates near grasp | Inconsistent operator technique across demos | Use single operator; filter demos by trajectory smoothness |
| High train loss, low success | Misaligned camera timestamps (>50ms offset) | Re-record with hardware sync; check USB bandwidth |
| Overfit: 95% train, 30% eval | Insufficient pose/lighting diversity | Add color jitter + random crop augmentation; collect 50+ demos with varied object positions |
| Policy ignores one camera | Redundant viewpoints; model shortcuts to easier camera | Random camera dropout during training (p=0.1-0.3) |
| Gripper never closes / always closed | Gripper action normalization error | Verify gripper action range matches hardware limits; check open/close polarity |
| Works day 1, fails day 2 | Camera or arm bumped; lighting changed | Add daily calibration check to deployment routine; mount cameras rigidly |
Metricas de éxito de las tareas: medición de la calidad de las políticas
La calidad de una política capacitada debe medirse mediante un protocolo de evaluación estructurado, no mediante observaciones informales.
- Taxa de éxito de tareas. La métrica principal: ¿qué fracción de los ensayos de evaluación completa con éxito la tarea completa? ejecutar un mínimo de 20 ensayos de evaluación por condición. Informar intervalos de confianza del 95% - con 20 ensayos, el intervalo es amplio (aproximadamente +/- 15%), por lo que no interprete en exceso pequeñas diferencias.
- Rata de finalización parcial. Para tareas de múltiples pasos, rastrear qué subtareas se completan incluso cuando la tarea completa falla. Una política que llega consistentemente al objeto pero no logra captar tiene un modo de falla diferente a uno que falla en la fase de aproximación.
- Performance en distribución versus fuera de distribución. Siempre reportar las tasas de éxito por separado para las condiciones observadas durante el entrenamiento y las condiciones no observadas durante el entrenamiento (objetos, posiciones o entornos retenidos). Consulte nuestra guía de generalización de políticas (T10) para los protocolos de evaluación.
- Métricas de calidad de la trayectoria. Más allá del éxito/fallo binario: la velocidad media (smoothness), la eficiencia de la longitud del camino (la longitud real del camino vs. el camino más corto posible), y el tiempo de ejecución en comparación con las demostraciones de expertos.
Monitoreo de la formación: patrones de pérdida de validación para observar
Durante la formación en políticas, monitoree estas señales para diagnosticar los problemas temprano:
** Plato de pérdida de validación.** Si la pérdida de validación deja de disminuir mientras la pérdida de entrenamiento continúa bajando, estás sobreajustado a tu conjunto de entrenamiento.
Ocillación de pérdida de validación. Los grandes cambios en la pérdida de validación indican una configuración de entrenamiento inestable. Reduzca la tasa de aprendizaje en 2-5 veces. Para la política de difusión, compruebe también si la variación del horario de ruido no es demasiado agresiva.
** Colapso de divergencia de KL (sólo ACT).** Si el término KL en la pérdida de ACT se reduce a cero al principio del entrenamiento, el espacio latente de CVAE se ha desplomado y la política está ignorando la variable latente. Aumenta el peso KL o utiliza un horario de calentamiento KL que aumenta gradualmente el peso durante el primer 20% del entrenamiento.
Erro de predicción de acción por paso de tiempo. Plot por paso de error de predicción de tiempo a través de la pieza de acción. Si el error aumenta drásticamente en pasos de tiempo posteriores (por ejemplo, paso 60+ en un pieza de 100 pasos), reduce la longitud de la pieza. Si el error es uniformemente alto, la capacidad del modelo puede ser insuficiente - aumentar la dimensión oculta del transformador o el número de cabezas de atención.
Despliegue de la inferencia: del modelo entrenado al robot real
La implementación de una política de TI capacitada en el hardware real introduce desafíos prácticos que las líneas de formación no exponen:
Drift de calibración de la cámara. Si la cámara se vuelve a montar o se vuelve a montar entre la recopilación de datos de entrenamiento y la implementación, incluso un cambio de 2-3 cm puede degradar el rendimiento de la política en un 10-20%.
Match de frecuencia de control. La política debe ejecutarse a la misma frecuencia de control que se recogieron las demostraciones. Si las demostraciones se recogieron a 50 Hz pero su tubería de inferencias se ejecuta a 20 Hz (porque la GPU no puede mantenerse al día), las predicciones de acción de la política se desalinarán temporalmente. O sea, desprende los datos de entrenamiento para que coincidan con la frecuencia de control de despliegue, o asegúrese de que su hardware de inferencia sea lo suficientemente rápido. ACT en una RTX 3090 alcanza aproximadamente 20 Hz con una sola cámara; añada una segunda cámara y el rendimiento cae a aproximadamente 15 Hz.
Limites de acción y límites de seguridad. Las salidas de las políticas primas deben filtrarse a través de una capa de seguridad antes de ser enviadas al robot: acoplar las acciones a los límites de articulación, aplicar límites de velocidad (normalmente 1,0-1,5 rad/s por articulación) y utilizar un filtro de bajo paso (5-10 Hz cortado) para eliminar el ruido de predicción de alta frecuencia. Esto añade 1-2 cuadros de latencia pero evita el daño hardware que pueden causar las salidas de políticas no filtradas.
Requisitos de datos para aprender imitando
El conjunto de datos mínimo viable para una sola tarea de manipulación es típicamente 50 demostraciones para ACT, 100-200 para Política de difusión y 20-50 para ajuste fino de VLA. Estas son estimaciones de piso en condiciones favorables - iluminación constante, puntos de vista fijos de la cámara y objetos en posiciones predecibles. El despliegue en el mundo real requiere 3-5 veces más datos para cubrir la variación que su sistema encontrará en la producción.
La calidad de los datos es tan importante como la cantidad. Las demostraciones deben ser recogidas por operadores calificados que completen la tarea de manera consistente y limpia. Los intentos fallidos, las dudas y las correcciones que entran en el conjunto de capacitación como éxitos etiquetados degradarán el rendimiento de las políticas. El [servicio de recogida de datos administrada] de RCSV (T12
La diversidad de los sensores también es importante. Las políticas entrenadas en una sola cámara de muñeca a menudo fallan cuando esa cámara está oculta. La mejor práctica es recopilar desde al menos dos puntos de vista de la cámara - una vista aérea o lateral fija y una montada en la muñeca - e incluir el estado propioceptivo (ángulos y velocidades conjuntas) junto con las observaciones visuales.
Hardware y infraestructura para la investigación de la IL
La pila de hardware mínima para un proyecto de investigación de aprendizaje imitativo incluye: un brazo robótico con suficientes grados de libertad para su tarea (al menos 6 DOF para la manipulación general), un sistema de teleoperación basado en el líder o la realidad virtual para la recopilación de datos, dos o más cámaras y una estación de trabajo con al menos una GPU NVIDIA (RTX 3090 o mejor para la política de ACT/Difusión; A100 o H100 recomendado para la ajuste fina de VLA).
El [catálogo de hardware] de RCSV incluye el [OpenArm 1] (T14
Para los equipos que quieran comenzar con datos antes de invertir en hardware, RCSV ofrece acceso a conjuntos de datos de demostración multitarea seleccionados recopilados en nuestra instalación de San Francisco. Estos conjuntos de datos cubren primitivas de manipulación comunes -- recoger, colocar, verter, plegar, montar -- y están formateados para uso directo con ACT, Política de difusión y abrazar la cara [LeRobot] [
Tabla de comparación de algoritmos: qué método IL para qué escenario
| Method | Min Demos | Multimodal? | Inference Speed | GPU Required | Best For |
|---|---|---|---|---|---|
| BC (MLP/ResNet) | 50 | No | ~1ms | RTX 3060+ | Simple short-horizon tasks, proprioception-only |
| ACT | 50 | Yes (CVAE) | ~50ms | RTX 3090+ | Bimanual, long-horizon, ALOHA-class hardware |
| Diffusion Policy | 200 | Yes (diffusion) | ~200ms (DDIM) | RTX 3090+ | Multi-strategy tasks, diverse demonstrations |
| VLA (OpenVLA) | 20 | Yes (language) | ~300ms | A100/H100 | Novel object generalization, language-conditioned tasks |
| GAIL | 10 | N/A (RL-based) | ~1ms | A100 (training) | Few demos + good sim (e.g., peg insertion in MuJoCo) |
| IBC | 100 | Yes (EBM) | ~200ms | RTX 3090+ | Contact-rich precision tasks with sharp modes |
El diagrama de flujo de decisión para la mayoría de los equipos: comience con ACT si tiene hardware bimanual o tareas de horizonte largo con menos de 200 demos. Utilice Política de difusión si tiene más de 200 demos y su tarea tiene múltiples estrategias válidas. Utilice ajuste fino VLA si necesita acondicionamiento de lenguaje o generalización de objetos novedosos con datos específicos de tareas mínimos. La BC es adecuada sólo para las tareas más simples y cortas o como base de diagnóstico.
La política de formación para múltiples tareas
La formación de una única política para manejar múltiples tareas de manipulación (pick-place, tiro abierto, vertido, etc.) es cada vez más práctica con las arquitecturas modernas.
El acondicionamiento de lenguaje es esencial para multitarea. Sin instrucciones de lenguaje, la política no tiene manera de saber qué tarea ejecutar. Las políticas de lenguaje acogen instrucciones como "recoger la taza roja" o "abrir el cajón superior" y el comportamiento de ruta en consecuencia. ACT y la Política de difusión apoyan el acondicionamiento de lenguaje a través de cabezas de codificador adicionales.
Equilibrio de datos entre tareas. Si recolectas 500 demostraciones de pick-place pero solo 50 de vertido, la política favorecerá fuertemente el comportamiento de pick-place.
Multi-task beneficia de la generalización. Contrariamente a lo intuitivo, el entrenamiento en 5 tareas con 100 demos cada una produce a menudo un mejor rendimiento por tarea que el entrenamiento en 1 tarea con 100 demos. Los [resultados de la X-Encarnación Abierta]
Trasas generales esperadas. El entrenamiento multitarea requiere 2-5 veces más computación que el entrenamiento de una sola tarea (más datos, grandes tamaños de lotes para la estabilidad). La velocidad de inferencia no cambia.
La sensibilidad a los hiperparámetros: lo que realmente importa
Los profesionales de la IL pasan demasiado tiempo sintonizando los hiperparámetros que no importan y demasiado poco en los que sí. Basándose en la experiencia de RCSV en la formación de cientos de políticas en ACT y Política de difusión, aquí hay un análisis de sensibilidad clasificado.
| Hyperparameter | Sensitivity | Recommended Default | When to Tune |
|---|---|---|---|
| Action chunk size (ACT) | Very High | 100 steps | Reduce to 20-50 for reactive tasks; increase to 150-200 for slow, smooth tasks |
| KL weight (ACT) | High | 10.0 | Increase (50-100) if multimodal demos; decrease (1-5) if all demos use same strategy |
| Noise schedule (Diffusion) | High | Cosine schedule, 100 diffusion steps | Reduce diffusion steps to 10-20 with DDIM for faster inference |
| Learning rate | Medium | 1e-5 (ACT), 3e-4 (Diffusion) | If training diverges, reduce 5x; if too slow, increase 2x |
| Batch size | Low | 8 (single GPU) | Increase to 16-32 if GPU memory allows for more stable training |
| Number of epochs | Low | 2000 | Use early stopping on validation loss; 2000 is typically sufficient for 200 demos |
| Image resolution | Low | 224x224 or 480x640 | Only increase if task requires fine visual detail (text reading, small object ID) |
Efectos de interacción: El tamaño de la pieza de acción y el peso de KL interactúan fuertemente en ACT. Un tamaño de pieza grande (150+) con bajo peso de KL (<5) produce trayectorias demasiado lisas y promedio que omiten movimientos precisos. Un tamaño de pieza grande con alto peso de KL (50+) produce modos de acción nítidos y distintos, pero puede oscilar entre los modos en medio de la tarea. El emparejamiento predeterminado (pieza=100, KL=10) funciona para la mayoría de las tareas. Sólo sintonicelas conjuntamente: si aumenta el tamaño de la pieza, aumenta el peso de KL proporcionalmente para mantener la diversidad de acción dentro de cada pieza.
La implicación práctica: si su política está con un rendimiento inferior, sintonice el tamaño de la pieza de acción y el peso KL (ACT) o el horario de ruido (Política de difusión) primero. Estos tienen un impacto del 10-20% en la tasa de éxito. La tasa de aprendizaje y el tamaño del lote tienen un impacto del 2-5%. La resolución de imagen y el número de épocas tienen un impacto <2% a menos que su línea de base esté gravemente mal configurada.
DAgger y HG-DAgger: Cuando el BC no es suficiente
La clonación conductual sufre de un error de composición: pequeños errores de predicción se acumulan con el tiempo porque los encuentros de políticas dicen que nunca fue entrenado (los errores de la política lo empujan fuera de la trayectoria demostrada por el experto).
** Protocolo estándar de DAgger:**
- Ejecutar una política inicial de BC en su conjunto de datos de demostración.
- El experto humano observa y registra las acciones que habrían tomado en cada paso (reetiquetando la trayectoria de la política con acciones de expertos).
- Añadir la trayectoria re-etiquetada al conjunto de entrenamiento y reentrenarlo.
- Repita entre 3 y 5 iteraciones hasta que la trayectoria de la política coincida con la del experto.
**HG-DAgger (Human-Gated DAgger) ** es la variante práctica para el aprendizaje real de robots. En lugar de que el experto reetiquete cada paso en el tiempo, el humano observa la ejecución de la política y sólo interviene cuando la política está a punto de fallar. Esto es 3-5 veces más rápido que el DAgger estándar porque el experto sólo actúa durante los estados críticos de falla.
Impacto esperado: HG-DAgger con 3 rondas de corrección (cada una añadiendo trajectorias de corrección 20-50) suele mejorar la tasa de éxito de tareas de largo horizonte en un 15-25% en comparación con el BC puro, con las mejoras más grandes en los estados de falla específicos dirigidos a las correcciones. Presupuesto de 2-4 horas de tiempo experto por ronda de DAgger.
Ensamblaje temporal y fragmentación de acción: detalles de implementación
Dos técnicas son críticas para reducir el error de composición que limita el rendimiento de BC: el chunking de acción (predecir múltiples acciones futuras a la vez) y el ensamblaje temporal (predecciones de acción superpuestas promedio).
Action chunking predice las próximas acciones K (tamaño de pieza K) de cada observación. El robot ejecuta todas las acciones K antes de volver a solicitar la política. Esto reduce el número de consultas de políticas por episodio de T (duración del episodio) a T/K, lo que significa que la política tiene K veces menos oportunidades de cometer errores que componen. Tamaños típicos de piezas: K=50-100 para ACT (predecir 1-2 segundos de acciones futuras a 50 Hz). Los piezas más grandes producen movimientos más suaves pero responden más lentamente a eventos inesperados; los piezas más pequeños son más reactivos pero más susceptibles a errores de composición.
** Ensamblaje temporal** promedia las predicciones de múltiples trozos superpuestos. En el paso de tiempo t, la política ha hecho predicciones para este paso de tiempo desde el paso actual y de los trozos anteriores superpuestos. El peso de ensamblaje temporal (w=0,01 en la configuración predeterminada de ACT) controla cuánto peso obtienen las predicciones recientes en comparación con las anteriores.
** Elegir el tamaño de la pieza:** El tamaño óptimo de la pieza depende de la estructura temporal de la tarea. Para tareas con fases distintas (aproximación, agarre, elevación, ubicación), el tamaño de la pieza debe ser lo suficientemente largo como para cubrir al menos una fase completa - típicamente 50-100 pasos a 50 Hz (1-2 segundos). Para las tareas reactivas en las que la política debe responder a los cambios ambientales dentro de los 200 ms (captura dinámica, inserción controlada por fuerza), reduce el tamaño de la pieza a 10-20 pasos.
** Detalle crítico de la implementación:** El ensamblaje temporal debe aplicarse antes del envío de acciones al robot, no después. La correcta implementación mantiene un buffer de acciones previstas pendientes de todos los trozos activos y calcula el promedio ponderado en cada paso de tiempo antes de ordenar al robot.
Los operadores de recopilación de datos de RCSV están capacitados tanto en los protocolos de corrección de teleoperación estándar como en los de HG-DAgger. Para los equipos que ya han capacitado una política y desean mejorarla mediante correcciones dirigidas en lugar de recopilar demostraciones completamente nuevas, la recopilación de datos de HG-DAgger está disponible como parte de nuestros servicios de datos.
Aprendizaje de imitación de múltiples tareas: arquitectura y consideraciones de datos
La formación de una única política para realizar múltiples tareas es más eficiente que la formación de políticas separadas, pero requiere opciones específicas de diseño de arquitectura y datos.
Condicionamiento de tareas. La política debe saber qué tarea realizar.
- ** Condicionamiento del lenguaje:** Proporcionar una instrucción de lenguaje natural ("recoger la taza roja") como entrada a la política. La instrucción está codificada por un modelo de lenguaje congelado (CLIP text encoder o oración-BERT) y concatena con características visuales. Este es el enfoque más flexible: la política puede generalizarse a nuevas instrucciones de lenguaje que combinan conceptos conocidos. Requiere anotaciones lingüísticas en los datos de formación.
- ** Incrustación ID de tarea:** Asesine a cada tarea un vector de embedding de aprendizaje. Es más simple que el condicionamiento del lenguaje y funciona cuando el conjunto de tareas está fijo. No generaliza a nuevas tareas sin reentrenamiento.
- Condicionamiento de la imagen de objetivo: Proporcionar una imagen del estado de objetivo deseado como entrada adicional. La política aprende a combinar las observaciones actuales con la meta. Requiere imágenes de objetivo en el momento de la inferencia, pero no necesita anotaciones lingüísticas durante el entrenamiento.
Equilibrio de datos entre las tareas. Si la tarea A tiene 500 demostraciones y la tarea B tiene 50, la política será muy sesgada hacia la tarea A. Utilice muestreo ponderado por temperatura durante el entrenamiento: muestre cada tarea con probabilidad proporcional a N_demos^1/T), donde T=2 funciona bien para un desequilibrio moderado. Para desequilibrio grave (10x+), recoger más datos para la tarea subrepresentada - los trucos de muestreo no pueden compensar completamente la diversidad faltante.
Los peligros comunes de la formación y sus soluciones
| Symptom | Likely Cause | Diagnostic | Fix |
|---|---|---|---|
| Robot moves to average of two positions | Mode averaging from MSE loss | Check if demos have multimodal actions for same observation | Switch to Diffusion Policy or increase ACT KL weight |
| Low validation loss but low success rate | Compounding error (policy drifts off-distribution) | Plot per-step error over rollout; look for divergence after step 20-30 | Increase chunk size, add temporal ensembling, or collect DAgger data |
| Training loss plateaus at high value | Noisy or inconsistent demonstrations | Visualize 20 random demos; check for strategy inconsistency | Filter demos by smoothness; retrain on clean subset |
| Robot overshoots targets consistently | Action space mismatch (delta vs absolute) | Check if demo actions are delta-position or absolute-position | Ensure training and inference use identical action representation |
| Works on one camera but not another | Camera extrinsics changed between collection and deployment | Compare camera mount position to training-time calibration | Recalibrate camera to match training position; or add camera pose to observation |
| Policy freezes mid-task | Observation out of training distribution | Log the observation embedding distance from training mean | Collect more demos in the OOD region; or add data augmentation |
Debugging workflow: Cuando una política entrenada falla en el robot real, siga esta secuencia de diagnóstico antes de concluir que el modelo es malo o que los datos son insuficientes:
- Verificar la coincidencia de las estadísticas de normalización de acción entre la configuración de entrenamiento y la configuración de despliegue.
- Las posiciones de la cámara de control no se han movido desde la recogida de datos (compara la superposición visual con una imagen de referencia).
- Ejecutar la política de un episodio de evaluación pregrabado en "modo de reproducción" para verificar que los resultados de la acción coinciden con los valores esperados.
- Visualice los mapas de atención de la política o las activaciones intermedias en la observación actual - si la atención está en el fondo en lugar de objetos relevantes para la tarea, la entrada visual puede estar corrompida o desalineada.
- Si todo lo anterior pasa, es probable que el problema sea la calidad o cantidad de datos.
Esta secuencia resuelve el 80% de los fallos de implementación de robots reales en 1-2 horas, evitando la recogida prematura de datos.
La trampa más común para los principiantes es la falta de coincidencia del espacio de acción: la política se entrena en acciones de posición delta (mover 5 mm a la derecha) pero se despliega en modo de posición absoluta (ir a x = 0,35), o viceversa. Esto produce un fracaso dramático (overshoting o apenas moviéndose) que parece un modelo roto pero en realidad es un error de configuración. Siempre verifique las convenciones del espacio de acción antes de deshacerse del modelo.
Lista de inicio rápido para su primer proyecto de IL
- ** Establezca criterios de éxito claros antes de comenzar.** Defina qué significa "éxito" para su tarea en términos medibles antes de recopilar cualquier dato. Para la colocación de piezas: "el objeto está a menos de 2 cm de la posición del objetivo y está estable (no rodando/cae) durante 1 segundo después de su liberación". Para la inserción: "el pieza está completamente insertada (a menos de 1 mm de profundidad del objetivo) sin exceder la fuerza de 30 N". Escriba los criterios de éxito en un documento compartido que todos los operadores y anotadores se refieran.
- Elige tu tarea. Comience con una tarea de pick-and-place de un solo brazo y un solo objeto. Este es el "mundo de hola" del aprendizaje de imitación y aparecerá todos los problemas de integración antes de abordar problemas más difíciles.
- Configurar hardware. Coloque su brazo, calibre las cámaras (intrínsecas + extrínsecas) y verifique los trabajos de control de teleoperatorio de extremo a extremo antes de recopilar cualquier dato.
- Recoge 50 demostraciones. Utilice una configuración de tareas consistente. Rechace los intentos fallidos. Este conjunto de datos inicial es para validar su pipeline de capacitación, no para una política desplegable.
- Train ACT. Utilice el script de entrenamiento [LeRobot]
T22 ) con hiperparámetros predeterminados. Monitoree la pérdida de validación durante 100 épocas. - Evalúa. Realice 20 ensayos en el robot real con objetos en posiciones de entrenamiento. Objetivo: tasa de éxito de 60% +. Si es inferior al 40%, haga un depósito de calidad de datos antes de recopilar más.
- Agrega la diversidad. Recolectar 100-200 demostraciones más con posiciones de objetos variadas, 2-3 instancias de objetos y cambios menores en la iluminación.
- Iterar. Identificar los modos de falla a través de una evaluación estructurada. Recopilar datos dirigidos a esos modos. Repitar hasta que estén listos para su implementación (sucesión del 85% en condiciones representativas).
Lectura relacionada
Guía de decisión de la política de acción contra la difusión · Modelos de VLA explicados · Guía de generalización de la política · LeRobot comenzando · Costo por análisis de demostración · Leyes de escala para el aprendizaje de robots · Servicios de datos
Comience su proyecto de aprendizaje por imitación
RCSV proporciona la pila completa: OpenArm 1 hardware ($4,500), gestión de la recopilación de datos ($2,500 piloto), y herramientas de plataforma para la gestión de conjuntos de datos y la formación de políticas. Ya sea que necesites 50 demostraciones para un prototipo o 2.000 para el despliegue de producción, nuestra instalación de San Francisco y operadores capacitados pueden llevarte a una política de trabajo más rápido que construir infraestructura interna.
[Contacta con nosotros para empezar]







