Volver a Guides

Aprendizaje por imitación para robots: ACT, Política de difusión, VLAs <unk> Guía práctica (2026)

Guía práctica completa para el aprendizaje de imitación para la robótica <unk> ACT, Política de difusión, OpenVLA, requisitos de datos, tuberías de capacitación y diagnóstico de modo de falla.

[← Guías]

Guía para practicantes de formación de robots de demostraciones humanas que cubre ACT, Política de difusión, OpenVLA, requisitos de datos, tuberías de formación, diagnóstico de modo de falla y estrategias de implementación para la manipulación en el mundo real.

¿Qué es aprender por imitación?

El aprendizaje por imitación entrena a un robot mostrándole ejemplos de comportamiento deseado. En lugar de programar manualmente las trayectorias o las funciones de recompensa de ingeniería para el aprendizaje de refuerzo, se demuestra la tarea a través de [teleoperación]T3) y el robot aprende a replicar su comportamiento a partir de los datos de demostración.

La idea central es sencilla: recoger un conjunto de datos de pares (observación, acción) de demostraciones humanas, luego entrenar una red neuronal para predecir la acción correcta dada la observación actual.

En la práctica, el aprendizaje por imitación es el método más confiable para conseguir que un robot realice una nueva tarea de manipulación en 2026. El aprendizaje por refuerzo requiere millones de interacciones ambientales y funciones de recompensa cuidadosamente modeladas. El aprendizaje de la imitación requiere sólo demostraciones y con arquitecturas modernas, sorprendentemente pocas de ellas.

Breve historia: desde la clonación de comportamiento hasta las arquitecturas modernas

**Cloning comportamental (BC) ** es la forma más simple: aprendizaje supervisado que mapea directamente las observaciones a las acciones. Entrenar una red neuronal en pares (imagen, posición conjunta) → (próxima\acción) utilizando pérdida de regresión estándar. BC funciona bien cuando los datos de demostración son consistentes y cubre la distribución de estados que el robot encuentra durante el despliegue. Se falla cuando el robot se desvía de la trayectoria demostrada un problema llamado error de composición o shift de distribución.

**DAgger (Agregación de Dataset) **, introducido por Ross et al. en 2011, aborda el cambio de distribución recogiendo iterativamente nuevas demostraciones en estados que el robot realmente visita. Después de entrenar una política BC inicial, la despliega, la deja driftar, y luego hace que el humano corrija los estados resultantes. Estas correcciones se añaden al conjunto de entrenamiento. DAgger es teóricamente elegante pero operacionalmente caro requiere un experto humano disponible durante cada iteración de entrenamiento.

**GAIL (Generative Adversarial Aprendizaje por Imitación) **, introducido por Ho y Ermon en 2016, combina el aprendizaje de imitación con el entrenamiento de adversarios: un discriminador aprende a distinguir el comportamiento del robot del comportamiento humano, y la política se entrena para engañar al discriminador. GAIL maneja mejor las demostraciones multimodal que BC, pero requiere interacción en el entorno en línea (normalmente en simulación) y es notoriamente difícil de sintonizar.

Los tres enfoques que dominan la manipulación de robots en el mundo real en 2026 ACT, Política de difusión y modelos VLA todos se basan en el paradigma de clonación conductual, pero añaden innovaciones arquitectónicas que abordan sus limitaciones centrales.

Por qué el aprendizaje por imitación ganó la manipulación

Antes de 2023, la mayoría de los laboratorios de robótica asumieron que el aprendizaje de refuerzo finalmente resolvería la manipulación. Esa expectativa no se ha materializado para tareas ricas en contacto.

  • Eficiencia de la muestra: Una política de aprendizaje de imitación útil se puede entrenar en 50500 demostraciones humanas recogidas en un solo día.
  • No hay ingeniería de recompensa: RL requiere una función de recompensa que capture exactamente lo que significa "éxito". Para tareas de manipulación como doblar una prenda o montar componentes, definir la recompensa es enormemente difícil. El aprendizaje de imitación evita el problema por completo las demostraciones humanas definen implícitamente el objetivo.
  • Los datos de teleoperación son naturales: El moderno hardware de teleoperación (armas de seguimiento del líder, controladores VR, guantes de exoesqueleto) facilita la recopilación de demostraciones de alta calidad.
  • Compatibilidad con el mundo real: Los trenes RL son los mejores en simulación, pero la transferencia sim-a-realidad para la manipulación rica en contacto sigue siendo poco confiable.
  • Composibilidad con modelos de base: Los modelos de lenguaje de visión pre-entrenados (SigLIP, DINOv2) proporcionan representaciones visuales poderosas que el aprendizaje de imitación puede aprovechar directamente.

RL todavía domina para la locomoción (G1 de Unitree, Atlas de Boston Dynamics) y para tareas con señales de recompensa claras (juego de juego, navegación). Para la manipulación recoger, colocar, insertar, plegar, verter, ensamblar aprendizaje de imitación es la opción práctica.

ACT: Acción con transformadores

ACT, introducido por Tony Zhao et al. en Stanford en 2023, es el caballo de trabajo del aprendizaje de imitación para la manipulación de mesa. Predece una chunk (secuencia) de acciones futuras en lugar de una sola acción siguiente, que aborda directamente el problema de error compuesto en la clonación conductual.

Cómo funciona ACT

ACT utiliza una arquitectura CVAE (Conditional Variational Codificador Automático) con una columna vertebral Transformer. El codificador procesa las imágenes de la cámara de observación actual que pasan a través de un codificador visual ResNet o ViT, más posiciones conjuntas y lo codifica en una representación latente. El decodificador toma este código latente y genera una secuencia de acciones futuras de k (típicamente k=100, que representa 2 segundos en el control de 50 Hz).

La idea clave es el "smoothing temporal through chunking": al predecir 100 acciones futuras a la vez, el modelo debe producir una trayectoria coherente, no sólo la siguiente acción inmediata.

Durante el despliegue, ACT utiliza ** ensamblaje temporal**: en cada paso temporal, genera una nueva pieza de acción de 100 pasos, pero la acción ejecutada es un promedio ponderado de las acciones previstas de la pieza actual y las piezas anteriores para este paso temporal. Esto suaviza aún más la trayectoria y reduce el nerviosismo.

Cuándo utilizar ACT

  • Manipulación de la mesa con 12 brazos robóticos (el caso de uso original de ALOHA)
  • Tarea con estrategias relativamente deterministas (posición de selección, inserción, montaje)
  • Cuando tienes 50 200 demostraciones y necesitas una línea de entrenamiento rápido
  • Cuando se necesita implementar en hardware modesto (se ejecuta en una GPU de un solo consumidor, ~ 15 ms de inferencia)

Requisitos típicos de datos para ACT

  • Simples y fácilmente elegibles: 50 demostraciones → 85% + éxito
  • Coordinación bimanual: 100 demostraciones → 80% + éxito
  • Inserción precisa (peg-in-hole, USB): 200 demostraciones → 70% + éxito
  • Complicaciones multistrés: se necesitan 400800 demostraciones

La calidad es más importante que la cantidad. 50 demostraciones limpias y consistentes a menudo superan a 500 de ruidosos.

Entrenamiento ACT con LeRobot

La forma más accesible de entrenar ACT en 2026 es a través del marco de Hugging Face LeRobot. Después de convertir sus datos de demostración HDF5 en formato LeRobot:

# Install LeRobot
pip install lerobot

# Convert your dataset
python -m lerobot.scripts.convert_dataset \
  --raw-dir ./my_episodes/ \
  --repo-id my-org/my-task \
  --raw-format hdf5_aloha

# Train ACT policy
python -m lerobot.scripts.train \
  policy=act \
  dataset_repo_id=my-org/my-task \
  training.num_epochs=2000 \
  training.batch_size=8

La formación generalmente converge en 28 horas en un solo RTX 4090 para conjuntos de datos de 100200 episodios.

ACT: Pros y contras

Pros Cons
Extremely data-efficient (50 demos for simple tasks) Struggles with multi-modal action distributions
Fast inference (50+ Hz on consumer GPU) No language conditioning
Smooth trajectories via temporal ensembling Sensitive to demonstration inconsistency
Well-supported in LeRobot framework Single-task only (one policy per task)
Low training compute (single GPU, hours) Temporal ensembling weight requires manual tuning

Política de difusión

La Política de difusión, introducida por Cheng Chi et al. en Columbia en 2023, aplica el marco de difusión denociante el mismo enfoque detrás de modelos de generación de imágenes como la difusión estable a la predicción de la acción del robot. Se ha convertido en la opción preferida para tareas donde existen múltiples estrategias válidas en los datos de demostración.

Cómo funciona la política de difusión

En lugar de predecir directamente las acciones, la Política de Difusión aprende a denotar iterativamente un vector de ruido aleatorio en una trayectoria de acción limpia. Durante el entrenamiento, toma una trayectoria de acción limpia de una demostración, agrega diferentes niveles de ruido gaussiano y entrena una red (generalmente una U-Net o Transformer) para predecir el ruido agregado. Durante la inferencia, comienza con ruido puro y lo denota iterativamente en K pasos (típicamente K=1050 usando la programación DDIM) para producir una trayectoria de acción limpia.

La ventaja crítica es multi-modalidad: los modelos de difusión representan naturalmente múltiples soluciones válidas. Si hay dos formas igualmente buenas de agarrar un objeto (enfoque de izquierda vs derecha), la política de difusión puede representar ambos modos sin mediarlos en una sola trayectoria media incorrecta. La clonación conductual estándar con pérdida de MSE promedias de modos, lo que es catastrófico para las tareas bimodal.

La política de difusión también produce trayectorias excepcionalmente suaves porque el proceso de desinfección genera secuencias de acción inherentemente temporales consistentes. Esto lo hace muy adecuado para tareas ricas en contactos como limpiar, verter y seguir la superficie donde la suavidad de la trayectoria afecta directamente al éxito.

Cuándo utilizar la política de difusión

  • tareas con múltiples estrategias válidas (los datos contienen diferentes enfoques para alcanzar el mismo objetivo)
  • tareas ricas en contactos donde las trayectorias de fuerza precisas son importantes
  • tareas que requieren una elevada suavidad de trayectoria (verter, dibujar, limpiar la superficie)
  • Cuando tienes datos de múltiples operadores con estilos ligeramente diferentes
  • Cuando tienes una GPU con suficiente computación para denociación iterativa (3080 ms de inferencia)

Requisitos típicos de datos para la política de difusión

  • Tarea simple unimodal: 100200 demostraciones
  • Tareales múltiples (múltiples estrategias válidas): 200500 demostraciones
  • Manipulación compleja en contacto: 5001,000 demostraciones

Diferencia clave con ACT: La política de difusión es menos sensible a la inconsistencia de demostración porque puede representar distribuciones multimodal.

Política de difusión: Pros y contras

Pros Cons
Handles multi-modal action distributions natively Slower inference than ACT (10-30 Hz)
Exceptionally smooth trajectories Needs more data than ACT for simple tasks
Robust to operator variation in demonstrations More hyperparameters (diffusion steps, noise schedule)
Strong performance on contact-rich tasks No language conditioning (without extensions)
Supported in LeRobot and robomimic Higher GPU memory requirements during training

Modelos de acción de OpenVLA y lenguaje de visión

Los modelos de visión-lenguaje-acción (VLA) representan la frontera del aprendizaje robótico en 2026. Combinan un modelo de lenguaje de visión pre-entrenado con predicción de acción, lo que permite a los robots seguir las instrucciones de lenguaje natural ("recoger la taza roja y colocarla en la bandeja") y generalizar entre las tareas y objetos que nunca han visto durante el ajuste fino.

Qué cambia con los modelos de fundación

El aprendizaje de imitación tradicional (ACT, Política de difusión) entrena políticas específicas de tareas desde cero. Cada nueva tarea requiere un nuevo conjunto de datos y una nueva carrera de capacitación. Los modelos VLA cambian esta ecuación proporcionando una representación pre-entrenada que ya entiende las escenas visuales y el lenguaje.

La consecuencia práctica: los modelos VLA pueden lograr un rendimiento razonable con menos demostraciones específicas de tareas porque el trabajo pesado de la comprensión visual y la conexión a tierra del lenguaje se realizó durante la pre-entrenamiento sobre datos a escala de Internet y grandes conjuntos de datos de robots transversales como Open X-Embodiment (970K+ episodios, 22+ tipos de robots).

Modelos clave de VLA

  • ** OpenVLA** (Berkeley, 2024): Parámetro de código abierto 7B VLA construido en Llama 2 + SigLIP. Entrenado en datos de Open X-Embodiment. Fine-tunes a nuevos robots con 100500 demostraciones.
  • ** pi0** (Inteligencia física, 20242025): VLA propietario entrenado en datos de encarnación cruzada, incluidas las manos destrezas. Transferencia demostrada de tiro cero a tareas no vistas. Disponible a través de la API de la Inteligencia Física.
  • Octo (Berkeley, 2024): Política generalista de parámetros 93M ligero. Diseñado para ajuste fino rápido con 50200 demostraciones.
  • RT-2 (Google DeepMind, 2023): 55B parámetro VLA basado en PaLM-E. Generalización de última generación pero requiere computación masiva (8 TPU v5e chips). No está disponible públicamente.

La ajuste fino vs entrenamiento desde cero

Auroración de un VLA pre-entrenado (el camino práctico): Comience desde un punto de control OpenVLA o Octo. Recoge 100500 demostraciones en tu robot.Auroración de un VLA pre-entrenado con LoRA (para modelos 7B+) o ajuste fino completo (para modelos a escala Octo). Tiempo de entrenamiento: 424 horas en 14 GPUs. Esto aprovecha las representaciones visuales y lingüísticas pre-entrenadas y es el enfoque recomendado para la mayoría de los equipos.

** Entrenamiento de un VLA desde cero** (sólo para laboratorios bien financiados): Requiere 10.000100.000+ demostraciones en diversos robots y tareas, más 1001,000+ horas de GPU. Sólo se justifica si está construyendo un modelo de base para una nueva clase de realización de robots o necesita capacidades no cubiertas por los VLA existentes.

Modelos de VLA: Pros y contras

Pros Cons
Language-conditioned task execution Slow inference (3-10 Hz)
Multi-task from a single model Requires A100-class GPU for 7B+ models
Strong generalization to new objects Fine-tuning is more complex than ACT/DP training
Leverages internet-scale pre-training Larger models are sensitive to prompt formatting
Cross-embodiment transfer potential Still maturing — fewer deployment success stories than ACT/DP

Tabla de comparación de algoritmos

Algorithm Data Efficiency Generalización Compute (Train) Compute (Infer) Ease of Training Best For
ACT Very high (50-200) Low (single task) 1 GPU, 2-8 hrs 50+ Hz, 1 GPU Easy Single-task tabletop, fast iteration
Diffusion Policy High (100-500) Medium (multi-strategy) 1 GPU, 4-16 hrs 10-30 Hz, 1 GPU Moderate Multi-modal tasks, contact-rich
Behavioral Cloning High (50-200) Very low 1 GPU, 1-4 hrs 100+ Hz Very easy Prototyping, baselines
GAIL Medium (100-1000) Medium Needs sim, days 50+ Hz Difficult Sim-only research, locomotion
OpenVLA / Octo High (50-500 fine-tune) High (cross-task) 1-4 A100s, 4-24 hrs 3-10 Hz, 1 A100 Moderate-Hard Multi-task, language-conditioned

El programa de formación: 5 etapas

En el curso de formación, los detalles de cada etapa son muy importantes para el desempeño final de la política.

Etapa 1: Recopilación de datos

Recoge demostraciones humanas a través de [teleoperatoria]T5. Utilice los brazos de seguidores de líder para obtener datos de la más alta calidad, o controladores VR para obtener un rendimiento más rápido en tareas de manipulación bruta. Graba a 50 Hz para datos conjuntos y 30 fps para cámaras. Almacena en formato HDF5. Consulte nuestro [guía de recopilación de datos]T6) para el protocolo completo.

Las decisiones críticas en esta etapa: número de demostraciones (ver recomendaciones específicas del algoritmo anteriormente), consistencia del operador (13 operadores para arranque), aleatorización en estado de arranque (varias posiciones de objetos de forma sistemática) y configuración de la cámara (mínimo: 1 muñeca + 1 cámara aérea).

Etapa 2: Formateo y procesamiento previo de datos

Convertir las grabaciones en bruto en formato listo para entrenamiento:

  • ** Redimensionamiento de imagen:** Redimensionar los marcos de la cámara a la resolución de entrada esperada del modelo (normalmente 224x224 para codificadores basados en ViT, 256x256 para ResNet).
  • ** Normalización de la acción:** Normaliza las acciones a [-1, 1] rango. Computa la media y la desviación estándar del conjunto de entrenamiento. Aplique la normalización idéntica en el despliegue una falta de coincidencia aquí causa falla silenciosa.
  • Filtración de episodios: Eliminar episodios fallidos, episodios con duración anómala (> 3 desviaciones estándar de la media) y episodios marcados durante la revisión de calidad.
  • ** Trenes/validación dividido:** Retener 1015% de los episodios para la validación. Dividido por episodio, nunca por marco poner los marcos del mismo episodio en los conjuntos de tren y validación crea filtración de datos.
  • Conversión de formato: Para el entrenamiento de LeRobot, convierta HDF5 en Parquet usando T1. Para robomimic, use su cargador HDF5 nativo. Consulte nuestra guía de formato de datos T7) para más detalles.

Etapa 3: Formación

Configuraciones típicas de entrenamiento por algoritmo:

  • ACT: 2.0005.000 épocas, tasa de aprendizaje 1e-5 con horario cosino, tamaño de lote 816. Tiempo de entrenamiento: 28 horas en una sola RTX 4090.
  • ** Política de difusión:** 5002,000 épocas, tasa de aprendizaje 1e-4 con horario cosino. DDPM con 100 pasos de difusión para el entrenamiento, DDIM con 1050 pasos para la inferencia. Tiempo de entrenamiento: 416 horas en una sola RTX 4090.
  • Auroración del VLA: 20100 épocas, tasa de aprendizaje 2e-5. LoRA (ranque 1664) para modelos 7B+ o ajuste delineado completo para modelos sub-1B. Tiempo de entrenamiento: 424 horas en 14 GPU A100.

Si la pérdida de validación se desvía de la pérdida de capacitación después de unos cientos de épocas, está sobreajustado reducir el recuento de épocas o añadir aumento de datos.

Etapa 4: Evaluación

La pérdida de validación es un predictor débil del rendimiento en el mundo real. La única evaluación confiable es implementar la política sobre el robot real y medir la tasa de éxito de la tarea. Realice al menos 20 ensayos de evaluación para obtener un resultado estadísticamente significativo (95% de intervalo de confianza es aproximadamente ± 20% con 20 ensayos, ± 10% con 50 ensayos).

Evaluar en dos condiciones: (1) posiciones nominales de los mismos objetos, la iluminación y los ángulos de la cámara que los datos de entrenamiento; (2) posiciones aleatorias perturbadas , iluminación variada o instancias de objetos no vistos. La brecha entre las tasas de éxito nominales y perturbadas revela el límite de generalización de su política.

Etapa 5: Despliegue

Exportar el modelo entrenado a ONNX o TorchScript para su implementación. ejecutar inferencias en la GPU de bordo del robot (NVIDIA Jetson Orin para embedded, RTX 4060+ para workstation). Monitorear la latencia de inferencias si la política no puede ejecutarse en la frecuencia de control del robot, utilizar el chunking de acción para predecir múltiples acciones futuras por llamada de inferencia.

Registre cada episodio de implementación para obtener comentarios de [data flywheel]T8. Incluya la versión de la política, los datos de observación, las acciones previstas y la etiqueta de resultados (éxito/fallo).

Requisitos de datos por algoritmo

Task Complexity ACT Diffusion Policy OpenVLA (fine-tune) Octo (fine-tune) Typical Success Rate
Simple pick-place 50 100 100 50 80-95%
Bimanual coordination 100 200 200 100 70-85%
Precise insertion 200 300 300 150 65-80%
Multi-step assembly 500 500 500 300 50-70%
Multi-task (language-cond.) N/A N/A 500-2000 200-1000 40-70%

Requisitos de hardware para la formación: ACT y la política de difusión entrenan en un solo RTX 3060 o mejor (16 GB de VRAM recomendado).

5 modalidades comunes de fallas y cómo solucionarlas

1. Cambios de distribución (error de composición)

Sintoma: La política funciona durante los primeros segundos, luego se desvía gradualmente de la trayectoria y falla.

** Causa raíz:** Pequeños errores de predicción se componen con el tiempo, empujando al robot a estados no representados en los datos de formación.

Fixes: Utilice el chunking de acción (ACT predice trozos de 100 pasos, reduciendo el número de puntos de decisión donde los errores pueden compoundse). Agregue aumento de imagen (ultragrados aleatorios, nerviosismo de color) durante el entrenamiento para hacer que el codificador visual sea robusto a ligeros cambios en el punto de vista. Recoge demostraciones de recuperación: ejecuta la política hasta que se desplace, luego teleopera desde el estado desviado hasta la finalización de la tarea. Estas correcciones de "estilo de Dagger" son los datos de mayor valor que puedes añadir.

2. Collapso de múltiples modalidades (medida de modo)

Síntomas: El robot se mueve hacia una posición entre dos estrategias válidas, sin llegar a ninguna.

** Causa raíz:** Los datos de formación contienen demostraciones con diferentes estrategias (enfoque de izquierda contra derecha), y la pérdida de MSE los promedia en una única trayectoria media incorrecta.

Fixes: Cambiar a la política de difusión, que representa las distribuciones multimodal de forma nativa. Si se queda con ACT, estandarizar la estrategia de demostración garantizar que todas las demostraciones siguen el mismo enfoque. Eliminar las demostraciones que utilizan estrategias minoritarias (menos del 20% del total).

3. Errores de composición de la predicción de acciones

Síntomas: El robot produce trayectorias correctas pero acumula errores de posición con el tiempo, lo que resulta en agarradas que están a 13 cm de distancia del objetivo.

** Causa raíz:** Desajuste de normalización de acción entre el entrenamiento y la implementación (valores medios/std diferentes), o la política predice acciones delta que acumulan error de punto flotante en trayectorias largas.

Fixes: Verificar que se utilizan exactamente las mismas estadísticas de normalización (media, std, min, max) durante el entrenamiento y el despliegue. Preferir objetivos de posición conjunta absolutas sobre acciones delta cuando sea posible.

4. Desajuste de hardware

Síntoma: Una política que funciona bien en la configuración original de recopilación de datos falla completamente cuando se desplaza a una tabla diferente, una iluminación diferente o una instancia diferente del mismo modelo de robot.

** Causa raíz:** Cambiar la posición de la cámara (incluso 5 mm de grado de agarre), cambiar las condiciones de iluminación (que afectan a las características visuales) o diferir la calibración de las articulaciones del robot entre las unidades.

Fixes: Montar permanentemente cámaras con fijos rígidos y verificar los extrínsecos antes de cada sesión de implementación. Utilice un objetivo de calibración (tabela ArUco) para comprobar la posición de la cámara. Para el despliegue de varios robots, recoge un pequeño conjunto de datos de calibración (2030 demostraciones) en cada unidad de robot. Aplique una aleatorización de dominio durante el entrenamiento: brillo aleatorio / contraste, recorte aleatorio de la cámara y texturas de fondo aleatorias.

5. Reset insuficientes

Síntoma: La política parece tener una baja tasa de éxito, pero una inspección más detallada revela que muchos fallos comienzan desde estados que están fuera de la distribución de entrenamiento objetos en posiciones incorrectas, robot que comienza desde una configuración no estándar.

** Causa raíz:** El protocolo de evaluación no reubica correctamente la escena en un estado dentro de la distribución de entrenamiento entre episodios.

Fixes: Definir criterios de restablecimiento explícitos: posiciones de objetos, configuración de la casa del robot y disposición de escena. Verificar la calidad de restablecimiento antes de cada episodio de evaluación. Durante la recopilación de datos, aleatorizar sistemáticamente los estados de inicio en toda la distribución de implementación prevista.

Evaluación sim-real

La formación en simulación y el despliegue en robots reales es atractiva porque los datos de simulación son esencialmente gratuitos. Pero la brecha de realidad hace que la simulación pura a la realidad sea poco confiable para la mayoría de las tareas de manipulación.

Cuando la simulación ayuda

  • Predefinición de simulación + ajuste real: Entrenamiento en 10.000100.000 episodios simulados, luego ajuste en 50200 episodios reales.
  • Randomizar el dominio: Alrededor de la simulación se pueden realizar características visuales (texturas, iluminación, posición de la cámara) y físicas (fricción, masa, amortiguación de las articulaciones).
  • Locomoción y control de todo el cuerpo: Sim-to-real funciona mucho mejor para la locomoción que para la manipulación.
  • ** Validación y depuración de políticas:** Ejecutar su política entrenada en simulación antes de implementarla en hardware real. La simulación detecta errores graves (espacio de acción incorrecto, errores de normalización, desajustes de frecuencia de control) sin correr el riesgo de daños en el hardware.

Cuando la simulación no ayuda

  • Puro simulación real para la manipulación rica en contactos: La simulación no puede modelar con precisión la fricción, la deformación y la dinámica de contacto de objetos reales.
  • Imágenes de cámaras simuladas como datos de formación: A pesar de los avances en la representación fotorrealista, las políticas entrenadas solo en imágenes simuladas muestran una tasa de éxito de degradación del 3050% en cámaras reales.
  • Tascas que involucran objetos deformables: Las telas, la cuerda y los alimentos son extremadamente difíciles de simular con precisión. Las políticas de manipulación deformable entrenadas por Sim rara vez se transfieren a hardware real sin datos reales extensos.

Comienza la lista de verificación

Sigue estos 10 pasos para pasar de cero a una política de aprendizaje de imitación implementada:

  1. Elige tu hardware robot. Para un primer proyecto: ViperX-300 S2, Koch v1.1, o [OpenArm]T9. Presupuesto: $2,000$8,000 para el brazo. Necesitas el control de posición a 50 Hz mínimo.
  2. Configurar la teleoperación. El brazo del líder para obtener la mayor calidad de datos o el controlador de realidad virtual (Meta Quest 3) para obtener un coste más bajo.
  3. Cámaras montadas. Mínimo: 1 cámara de muñeca (Intel RealSense D405) + 1 cámara de sobrecarga (RealSense D435). Utilice monturas rígidas Las cámaras no deben moverse entre la recogida y el despliegue.
  4. Instale software de grabación. Utilice las herramientas de grabación de datos de LeRobot o la pila de grabación ALOHA. Verifique que la salida HDF5 incluye imágenes, posiciones conjuntas y acciones a las frecuencias correctas.
  5. Defina tu primera tarea. Comience con una simple: escoge un solo objeto de una ubicación fija y coloca en una zona objetivo.
  6. Recoge 50 demostraciones. Operador consistente, estrategia consistente. Tómate 10 minutos entre cada 20 episodios para comprobar la calidad de los datos. Rechace y vuelve a grabar los episodios malos de inmediato.
  7. ** Entrenamiento de su primera política de ACT.** Utilice el guión de entrenamiento de LeRobot con hiperparámetros predeterminados.
  8. Run 20 ensayos de evaluación. Reinicie la escena idéntica antes de cada ensayo. Graba el éxito/fallo y guarde el video de cada ensayo para el análisis de fallas.
  9. Diágnose de fallas y recopile datos específicos. Identifique el modo de fallas más común. Recopile 2030 demostraciones específicamente dirigidas a ese fallo.
  10. Iterar hasta >80% de la tasa de éxito. La mayoría de los equipos alcanzan el 80%+ en 23 ciclos de formación de recogida para tareas simples. Luego comienzan a expandirse a las operaciones [data flywheel]T11).

Preguntas frecuentes

¿Cuántas demostraciones necesito?

Para ACT en una simple tarea de pick-and-place: 50 demostraciones suelen ser suficientes para una tasa de éxito de más del 80%. Para la política de difusión: comience con 100200. Para el ajuste fino de VLA: 100500 dependiendo de la complejidad de la tarea. En todos los casos, la calidad de los datos importa más que la cantidad 50 demostraciones limpias superan a las 500 ruidosas.

¿Qué tipo de acción debería elegir?

Si su tarea tiene una única estrategia clara y desea el camino más rápido para su implementación, utilice ACT. Si sus datos contienen múltiples enfoques válidos para la misma tarea (múltiples operadores, estrategias de captura ambigüas), utilice la Política de difusión. Si necesita una ejecución multicomisión con lenguaje condicionado, utilice un VLA. Cuando tengas dudas, comienza con ACT que se entrena más rápido y te permite validar tu línea de recopilación de datos antes de invertir en modelos más complejos.

¿Puedo usar los datos de la simulación?

Los datos de simulación por sí solos no son confiables para la manipulación rica en contactos. El enfoque más efectivo es el pre-entrenamiento de simulación + ajuste fino real: entrenar en 10.000+ episodios simulados, luego ajuste fino en 50200 episodios reales. Para las tareas de locomoción, el sim-to-real puro con aleatorización de dominio funciona bien. Para la manipulación, siempre planea recopilar algunos datos reales.

¿Qué hardware robótico necesito?

Como mínimo: un brazo robot con control de posición a 50 Hz (ViperX-300, Koch v1.1, OpenArm, o similar), una interfaz de teleoperación (brazo líder o controlador VR), 23 cámaras (muñeca + sobrecarga), y una estación de trabajo con una GPU NVIDIA (RTX 3060 o mejor para ACT, RTX 4090 o A100 para Política de difusión y VLAs).

¿Cuál es la diferencia entre el aprendizaje por imitación y el aprendizaje por refuerzo?

Los trenes de aprendizaje de imitación se desarrollan a partir de demostraciones humanas. Se muestra al robot lo que debe hacer. El robot explora y aprende qué acciones maximizan la recompensa. Para la manipulación, el aprendizaje de imitación es mucho más eficiente en la muestra (50500 demostraciones frente a millones de pasos de RL) y no requiere ingeniería de recompensa. RL domina para la locomoción y tareas con señales de recompensa claras.

¿Cuánto tiempo lleva el entrenamiento?

ACT en 200 episodios: 28 horas en un solo RTX 4090. Política de difusión en 500 episodios: 416 horas. VLA ajuste fino en 500 episodios: 424 horas en 14 GPU A100. El verdadero cuello de botella es generalmente la recopilación y evaluación de datos, no la formación en computación.

¿Qué formato de datos debo usar?

HDF5 es el formato estándar para los datos de demostración de robots. Almacenar posiciones conjuntas (qpos), velocidades (qvel), imágenes de cámara y acciones como conjuntos de datos separados dentro de cada archivo de episodio. Para entrenar con LeRobot, convierta al formato Parquet. Consulte nuestra guía de formato de datos (T12) para obtener especificaciones detalladas.

¿Puede el aprendizaje de imitación funcionar para la manipulación móvil?

Sí, pero requiere significativamente más datos (5002,000+ demostraciones) porque el espacio de estado es más grande. Los modelos VLA como OpenVLA y pi0 son más adecuados para la manipulación móvil porque su pre-entrenamiento cubre diversas realizaciones. Para las tareas de mesa, ACT y la Política de difusión siguen siendo las opciones más prácticas.

Obtenga los datos de su formación recogidos por los expertos del RCSV

RCSV ofrece servicios de recogida de datos de extremo a extremo: operadores capacitados, hardware calibrado, control de calidad y entrega en su formato objetivo.

[Servicios de recopilación de datos] [T13] [Primar hardware para su piloto] [T14)