Aprendizaje por imitación para robots: ACT, Política de difusión, VLAs <unk> Guía práctica (2026)
Guía práctica completa para el aprendizaje de imitación para la robótica <unk> ACT, Política de difusión, OpenVLA, requisitos de datos, tuberías de capacitación y diagnóstico de modo de falla.
[← Guías]
Guía para practicantes de formación de robots de demostraciones humanas
¿Qué es aprender por imitación?
El aprendizaje por imitación entrena a un robot mostrándole ejemplos de comportamiento deseado. En lugar de programar manualmente las trayectorias o las funciones de recompensa de ingeniería para el aprendizaje de refuerzo, se demuestra la tarea a través de [teleoperación]
La idea central es sencilla: recoger un conjunto de datos de pares (observación, acción) de demostraciones humanas, luego entrenar una red neuronal para predecir la acción correcta dada la observación actual.
En la práctica, el aprendizaje por imitación es el método más confiable para conseguir que un robot realice una nueva tarea de manipulación en 2026. El aprendizaje por refuerzo requiere millones de interacciones ambientales y funciones de recompensa cuidadosamente modeladas. El aprendizaje de la imitación requiere sólo demostraciones
Breve historia: desde la clonación de comportamiento hasta las arquitecturas modernas
**Cloning comportamental (BC) ** es la forma más simple: aprendizaje supervisado que mapea directamente las observaciones a las acciones. Entrenar una red neuronal en pares (imagen, posición conjunta) → (próxima\acción) utilizando pérdida de regresión estándar. BC funciona bien cuando los datos de demostración son consistentes y cubre la distribución de estados que el robot encuentra durante el despliegue. Se falla cuando el robot se desvía de la trayectoria demostrada
**DAgger (Agregación de Dataset) **, introducido por Ross et al. en 2011, aborda el cambio de distribución recogiendo iterativamente nuevas demostraciones en estados que el robot realmente visita. Después de entrenar una política BC inicial, la despliega, la deja driftar, y luego hace que el humano corrija los estados resultantes. Estas correcciones se añaden al conjunto de entrenamiento. DAgger es teóricamente elegante pero operacionalmente caro
**GAIL (Generative Adversarial Aprendizaje por Imitación) **, introducido por Ho y Ermon en 2016, combina el aprendizaje de imitación con el entrenamiento de adversarios: un discriminador aprende a distinguir el comportamiento del robot del comportamiento humano, y la política se entrena para engañar al discriminador. GAIL maneja mejor las demostraciones multimodal que BC, pero requiere interacción en el entorno en línea (normalmente en simulación) y es notoriamente difícil de sintonizar.
Los tres enfoques que dominan la manipulación de robots en el mundo real en 2026
Por qué el aprendizaje por imitación ganó la manipulación
Antes de 2023, la mayoría de los laboratorios de robótica asumieron que el aprendizaje de refuerzo finalmente resolvería la manipulación. Esa expectativa no se ha materializado para tareas ricas en contacto.
- Eficiencia de la muestra: Una política de aprendizaje de imitación útil se puede entrenar en 50
500 demostraciones humanas recogidas en un solo día. - No hay ingeniería de recompensa: RL requiere una función de recompensa que capture exactamente lo que significa "éxito". Para tareas de manipulación como doblar una prenda o montar componentes, definir la recompensa es enormemente difícil. El aprendizaje de imitación evita el problema por completo
las demostraciones humanas definen implícitamente el objetivo. - Los datos de teleoperación son naturales: El moderno hardware de teleoperación (armas de seguimiento del líder, controladores VR, guantes de exoesqueleto) facilita la recopilación de demostraciones de alta calidad.
- Compatibilidad con el mundo real: Los trenes RL son los mejores en simulación, pero la transferencia sim-a-realidad para la manipulación rica en contacto sigue siendo poco confiable.
- Composibilidad con modelos de base: Los modelos de lenguaje de visión pre-entrenados (SigLIP, DINOv2) proporcionan representaciones visuales poderosas que el aprendizaje de imitación puede aprovechar directamente.
RL todavía domina para la locomoción (G1 de Unitree, Atlas de Boston Dynamics) y para tareas con señales de recompensa claras (juego de juego, navegación). Para la manipulación
ACT: Acción con transformadores
ACT, introducido por Tony Zhao et al. en Stanford en 2023, es el caballo de trabajo del aprendizaje de imitación para la manipulación de mesa. Predece una chunk (secuencia) de acciones futuras en lugar de una sola acción siguiente, que aborda directamente el problema de error compuesto en la clonación conductual.
Cómo funciona ACT
ACT utiliza una arquitectura CVAE (Conditional Variational Codificador Automático) con una columna vertebral Transformer. El codificador procesa las imágenes de la cámara de observación actual que pasan a través de un codificador visual ResNet o ViT, más posiciones conjuntas
La idea clave es el "smoothing temporal through chunking": al predecir 100 acciones futuras a la vez, el modelo debe producir una trayectoria coherente, no sólo la siguiente acción inmediata.
Durante el despliegue, ACT utiliza ** ensamblaje temporal**: en cada paso temporal, genera una nueva pieza de acción de 100 pasos, pero la acción ejecutada es un promedio ponderado de las acciones previstas de la pieza actual y las piezas anteriores para este paso temporal. Esto suaviza aún más la trayectoria y reduce el nerviosismo.
Cuándo utilizar ACT
- Manipulación de la mesa con 1
2 brazos robóticos (el caso de uso original de ALOHA) - Tarea con estrategias relativamente deterministas (posición de selección, inserción, montaje)
- Cuando tienes 50
200 demostraciones y necesitas una línea de entrenamiento rápido - Cuando se necesita implementar en hardware modesto (se ejecuta en una GPU de un solo consumidor, ~ 15 ms de inferencia)
Requisitos típicos de datos para ACT
- Simples y fácilmente elegibles: 50 demostraciones → 85% + éxito
- Coordinación bimanual: 100 demostraciones → 80% + éxito
- Inserción precisa (peg-in-hole, USB): 200 demostraciones → 70% + éxito
- Complicaciones multistrés: se necesitan 400
800 demostraciones
La calidad es más importante que la cantidad. 50 demostraciones limpias y consistentes a menudo superan a 500 de ruidosos.
Entrenamiento ACT con LeRobot
La forma más accesible de entrenar ACT en 2026 es a través del marco de Hugging Face LeRobot. Después de convertir sus datos de demostración HDF5 en formato LeRobot:
# Install LeRobot
pip install lerobot
# Convert your dataset
python -m lerobot.scripts.convert_dataset \
--raw-dir ./my_episodes/ \
--repo-id my-org/my-task \
--raw-format hdf5_aloha
# Train ACT policy
python -m lerobot.scripts.train \
policy=act \
dataset_repo_id=my-org/my-task \
training.num_epochs=2000 \
training.batch_size=8
La formación generalmente converge en 2
ACT: Pros y contras
| Pros | Cons |
|---|---|
| Extremely data-efficient (50 demos for simple tasks) | Struggles with multi-modal action distributions |
| Fast inference (50+ Hz on consumer GPU) | No language conditioning |
| Smooth trajectories via temporal ensembling | Sensitive to demonstration inconsistency |
| Well-supported in LeRobot framework | Single-task only (one policy per task) |
| Low training compute (single GPU, hours) | Temporal ensembling weight requires manual tuning |
Política de difusión
La Política de difusión, introducida por Cheng Chi et al. en Columbia en 2023, aplica el marco de difusión denociante
Cómo funciona la política de difusión
En lugar de predecir directamente las acciones, la Política de Difusión aprende a denotar iterativamente un vector de ruido aleatorio en una trayectoria de acción limpia. Durante el entrenamiento, toma una trayectoria de acción limpia de una demostración, agrega diferentes niveles de ruido gaussiano y entrena una red (generalmente una U-Net o Transformer) para predecir el ruido agregado. Durante la inferencia, comienza con ruido puro y lo denota iterativamente en K pasos (típicamente K=10
La ventaja crítica es multi-modalidad: los modelos de difusión representan naturalmente múltiples soluciones válidas. Si hay dos formas igualmente buenas de agarrar un objeto (enfoque de izquierda vs derecha), la política de difusión puede representar ambos modos sin mediarlos en una sola trayectoria media incorrecta. La clonación conductual estándar con pérdida de MSE promedias de modos, lo que es catastrófico para las tareas bimodal.
La política de difusión también produce trayectorias excepcionalmente suaves porque el proceso de desinfección genera secuencias de acción inherentemente temporales consistentes. Esto lo hace muy adecuado para tareas ricas en contactos como limpiar, verter y seguir la superficie donde la suavidad de la trayectoria afecta directamente al éxito.
Cuándo utilizar la política de difusión
- tareas con múltiples estrategias válidas (los datos contienen diferentes enfoques para alcanzar el mismo objetivo)
- tareas ricas en contactos donde las trayectorias de fuerza precisas son importantes
- tareas que requieren una elevada suavidad de trayectoria (verter, dibujar, limpiar la superficie)
- Cuando tienes datos de múltiples operadores con estilos ligeramente diferentes
- Cuando tienes una GPU con suficiente computación para denociación iterativa (30
80 ms de inferencia)
Requisitos típicos de datos para la política de difusión
- Tarea simple unimodal: 100
200 demostraciones - Tareales múltiples (múltiples estrategias válidas): 200
500 demostraciones - Manipulación compleja en contacto: 500
1,000 demostraciones
Diferencia clave con ACT: La política de difusión es menos sensible a la inconsistencia de demostración porque puede representar distribuciones multimodal.
Política de difusión: Pros y contras
| Pros | Cons |
|---|---|
| Handles multi-modal action distributions natively | Slower inference than ACT (10-30 Hz) |
| Exceptionally smooth trajectories | Needs more data than ACT for simple tasks |
| Robust to operator variation in demonstrations | More hyperparameters (diffusion steps, noise schedule) |
| Strong performance on contact-rich tasks | No language conditioning (without extensions) |
| Supported in LeRobot and robomimic | Higher GPU memory requirements during training |
Modelos de acción de OpenVLA y lenguaje de visión
Los modelos de visión-lenguaje-acción (VLA) representan la frontera del aprendizaje robótico en 2026. Combinan un modelo de lenguaje de visión pre-entrenado con predicción de acción, lo que permite a los robots seguir las instrucciones de lenguaje natural ("recoger la taza roja y colocarla en la bandeja") y generalizar entre las tareas y objetos que nunca han visto durante el ajuste fino.
Qué cambia con los modelos de fundación
El aprendizaje de imitación tradicional (ACT, Política de difusión) entrena políticas específicas de tareas desde cero. Cada nueva tarea requiere un nuevo conjunto de datos y una nueva carrera de capacitación. Los modelos VLA cambian esta ecuación proporcionando una representación pre-entrenada que ya entiende las escenas visuales y el lenguaje.
La consecuencia práctica: los modelos VLA pueden lograr un rendimiento razonable con menos demostraciones específicas de tareas porque el trabajo pesado de la comprensión visual y la conexión a tierra del lenguaje se realizó durante la pre-entrenamiento sobre datos a escala de Internet y grandes conjuntos de datos de robots transversales como Open X-Embodiment (970K+ episodios, 22+ tipos de robots).
Modelos clave de VLA
- ** OpenVLA** (Berkeley, 2024): Parámetro de código abierto 7B VLA construido en Llama 2 + SigLIP. Entrenado en datos de Open X-Embodiment. Fine-tunes a nuevos robots con 100
500 demostraciones. - ** pi0** (Inteligencia física, 2024
2025): VLA propietario entrenado en datos de encarnación cruzada, incluidas las manos destrezas. Transferencia demostrada de tiro cero a tareas no vistas. Disponible a través de la API de la Inteligencia Física. - Octo (Berkeley, 2024): Política generalista de parámetros 93M ligero. Diseñado para ajuste fino rápido con 50
200 demostraciones. - RT-2 (Google DeepMind, 2023): 55B parámetro VLA basado en PaLM-E. Generalización de última generación pero requiere computación masiva (8 TPU v5e chips). No está disponible públicamente.
La ajuste fino vs entrenamiento desde cero
Auroración de un VLA pre-entrenado (el camino práctico): Comience desde un punto de control OpenVLA o Octo. Recoge 100
** Entrenamiento de un VLA desde cero** (sólo para laboratorios bien financiados): Requiere 10.000
Modelos de VLA: Pros y contras
| Pros | Cons |
|---|---|
| Language-conditioned task execution | Slow inference (3-10 Hz) |
| Multi-task from a single model | Requires A100-class GPU for 7B+ models |
| Strong generalization to new objects | Fine-tuning is more complex than ACT/DP training |
| Leverages internet-scale pre-training | Larger models are sensitive to prompt formatting |
| Cross-embodiment transfer potential | Still maturing — fewer deployment success stories than ACT/DP |
Tabla de comparación de algoritmos
| Algorithm | Data Efficiency | Generalización | Compute (Train) | Compute (Infer) | Ease of Training | Best For |
|---|---|---|---|---|---|---|
| ACT | Very high (50-200) | Low (single task) | 1 GPU, 2-8 hrs | 50+ Hz, 1 GPU | Easy | Single-task tabletop, fast iteration |
| Diffusion Policy | High (100-500) | Medium (multi-strategy) | 1 GPU, 4-16 hrs | 10-30 Hz, 1 GPU | Moderate | Multi-modal tasks, contact-rich |
| Behavioral Cloning | High (50-200) | Very low | 1 GPU, 1-4 hrs | 100+ Hz | Very easy | Prototyping, baselines |
| GAIL | Medium (100-1000) | Medium | Needs sim, days | 50+ Hz | Difficult | Sim-only research, locomotion |
| OpenVLA / Octo | High (50-500 fine-tune) | High (cross-task) | 1-4 A100s, 4-24 hrs | 3-10 Hz, 1 A100 | Moderate-Hard | Multi-task, language-conditioned |
El programa de formación: 5 etapas
En el curso de formación, los detalles de cada etapa son muy importantes para el desempeño final de la política.
Etapa 1: Recopilación de datos
Recoge demostraciones humanas a través de [teleoperatoria]
Las decisiones críticas en esta etapa: número de demostraciones (ver recomendaciones específicas del algoritmo anteriormente), consistencia del operador (1
Etapa 2: Formateo y procesamiento previo de datos
Convertir las grabaciones en bruto en formato listo para entrenamiento:
- ** Redimensionamiento de imagen:** Redimensionar los marcos de la cámara a la resolución de entrada esperada del modelo (normalmente 224x224 para codificadores basados en ViT, 256x256 para ResNet).
- ** Normalización de la acción:** Normaliza las acciones a [-1, 1] rango. Computa la media y la desviación estándar del conjunto de entrenamiento. Aplique la normalización idéntica en el despliegue
una falta de coincidencia aquí causa falla silenciosa. - Filtración de episodios: Eliminar episodios fallidos, episodios con duración anómala (> 3 desviaciones estándar de la media) y episodios marcados durante la revisión de calidad.
- ** Trenes/validación dividido:** Retener 10
15% de los episodios para la validación. Dividido por episodio, nunca por marco poner los marcos del mismo episodio en los conjuntos de tren y validación crea filtración de datos. - Conversión de formato: Para el entrenamiento de LeRobot, convierta HDF5 en Parquet usando
T1 . Para robomimic, use su cargador HDF5 nativo. Consulte nuestra guía de formato de datos T7 ) para más detalles.
Etapa 3: Formación
Configuraciones típicas de entrenamiento por algoritmo:
- ACT: 2.000
5.000 épocas, tasa de aprendizaje 1e-5 con horario cosino, tamaño de lote 8 16. Tiempo de entrenamiento: 2 8 horas en una sola RTX 4090. - ** Política de difusión:** 500
2,000 épocas, tasa de aprendizaje 1e-4 con horario cosino. DDPM con 100 pasos de difusión para el entrenamiento, DDIM con 10 50 pasos para la inferencia. Tiempo de entrenamiento: 4 16 horas en una sola RTX 4090. - Auroración del VLA: 20
100 épocas, tasa de aprendizaje 2e-5. LoRA (ranque 16 64) para modelos 7B+ o ajuste delineado completo para modelos sub-1B. Tiempo de entrenamiento: 4 24 horas en 1 4 GPU A100.
Si la pérdida de validación se desvía de la pérdida de capacitación después de unos cientos de épocas, está sobreajustado
Etapa 4: Evaluación
La pérdida de validación es un predictor débil del rendimiento en el mundo real. La única evaluación confiable es implementar la política sobre el robot real y medir la tasa de éxito de la tarea. Realice al menos 20 ensayos de evaluación para obtener un resultado estadísticamente significativo (95% de intervalo de confianza es aproximadamente ± 20% con 20 ensayos, ± 10% con 50 ensayos).
Evaluar en dos condiciones: (1) posiciones nominales
Etapa 5: Despliegue
Exportar el modelo entrenado a ONNX o TorchScript para su implementación. ejecutar inferencias en la GPU de bordo del robot (NVIDIA Jetson Orin para embedded, RTX 4060+ para workstation). Monitorear la latencia de inferencias
Registre cada episodio de implementación para obtener comentarios de [data flywheel]
Requisitos de datos por algoritmo
| Task Complexity | ACT | Diffusion Policy | OpenVLA (fine-tune) | Octo (fine-tune) | Typical Success Rate |
|---|---|---|---|---|---|
| Simple pick-place | 50 | 100 | 100 | 50 | 80-95% |
| Bimanual coordination | 100 | 200 | 200 | 100 | 70-85% |
| Precise insertion | 200 | 300 | 300 | 150 | 65-80% |
| Multi-step assembly | 500 | 500 | 500 | 300 | 50-70% |
| Multi-task (language-cond.) | N/A | N/A | 500-2000 | 200-1000 | 40-70% |
Requisitos de hardware para la formación: ACT y la política de difusión entrenan en un solo RTX 3060 o mejor (16 GB de VRAM recomendado).
5 modalidades comunes de fallas y cómo solucionarlas
1. Cambios de distribución (error de composición)
Sintoma: La política funciona durante los primeros segundos, luego se desvía gradualmente de la trayectoria y falla.
** Causa raíz:** Pequeños errores de predicción se componen con el tiempo, empujando al robot a estados no representados en los datos de formación.
Fixes: Utilice el chunking de acción (ACT predice trozos de 100 pasos, reduciendo el número de puntos de decisión donde los errores pueden compoundse). Agregue aumento de imagen (ultragrados aleatorios, nerviosismo de color) durante el entrenamiento para hacer que el codificador visual sea robusto a ligeros cambios en el punto de vista. Recoge demostraciones de recuperación: ejecuta la política hasta que se desplace, luego teleopera desde el estado desviado hasta la finalización de la tarea. Estas correcciones de "estilo de Dagger" son los datos de mayor valor que puedes añadir.
2. Collapso de múltiples modalidades (medida de modo)
Síntomas: El robot se mueve hacia una posición entre dos estrategias válidas, sin llegar a ninguna.
** Causa raíz:** Los datos de formación contienen demostraciones con diferentes estrategias (enfoque de izquierda contra derecha), y la pérdida de MSE los promedia en una única trayectoria media incorrecta.
Fixes: Cambiar a la política de difusión, que representa las distribuciones multimodal de forma nativa. Si se queda con ACT, estandarizar la estrategia de demostración
3. Errores de composición de la predicción de acciones
Síntomas: El robot produce trayectorias correctas pero acumula errores de posición con el tiempo, lo que resulta en agarradas que están a 1
** Causa raíz:** Desajuste de normalización de acción entre el entrenamiento y la implementación (valores medios/std diferentes), o la política predice acciones delta que acumulan error de punto flotante en trayectorias largas.
Fixes: Verificar que se utilizan exactamente las mismas estadísticas de normalización (media, std, min, max) durante el entrenamiento y el despliegue. Preferir objetivos de posición conjunta absolutas sobre acciones delta cuando sea posible.
4. Desajuste de hardware
Síntoma: Una política que funciona bien en la configuración original de recopilación de datos falla completamente cuando se desplaza a una tabla diferente, una iluminación diferente o una instancia diferente del mismo modelo de robot.
** Causa raíz:** Cambiar la posición de la cámara (incluso 5 mm de grado de agarre), cambiar las condiciones de iluminación (que afectan a las características visuales) o diferir la calibración de las articulaciones del robot entre las unidades.
Fixes: Montar permanentemente cámaras con fijos rígidos y verificar los extrínsecos antes de cada sesión de implementación. Utilice un objetivo de calibración (tabela ArUco) para comprobar la posición de la cámara. Para el despliegue de varios robots, recoge un pequeño conjunto de datos de calibración (20
5. Reset insuficientes
Síntoma: La política parece tener una baja tasa de éxito, pero una inspección más detallada revela que muchos fallos comienzan desde estados que están fuera de la distribución de entrenamiento
** Causa raíz:** El protocolo de evaluación no reubica correctamente la escena en un estado dentro de la distribución de entrenamiento entre episodios.
Fixes: Definir criterios de restablecimiento explícitos: posiciones de objetos, configuración de la casa del robot y disposición de escena. Verificar la calidad de restablecimiento antes de cada episodio de evaluación. Durante la recopilación de datos, aleatorizar sistemáticamente los estados de inicio en toda la distribución de implementación prevista.
Evaluación sim-real
La formación en simulación y el despliegue en robots reales es atractiva porque los datos de simulación son esencialmente gratuitos. Pero la brecha de realidad hace que la simulación pura a la realidad sea poco confiable para la mayoría de las tareas de manipulación.
Cuando la simulación ayuda
- Predefinición de simulación + ajuste real: Entrenamiento en 10.000
100.000 episodios simulados, luego ajuste en 50 200 episodios reales. - Randomizar el dominio: Alrededor de la simulación se pueden realizar características visuales (texturas, iluminación, posición de la cámara) y físicas (fricción, masa, amortiguación de las articulaciones).
- Locomoción y control de todo el cuerpo: Sim-to-real funciona mucho mejor para la locomoción que para la manipulación.
- ** Validación y depuración de políticas:** Ejecutar su política entrenada en simulación antes de implementarla en hardware real. La simulación detecta errores graves (espacio de acción incorrecto, errores de normalización, desajustes de frecuencia de control) sin correr el riesgo de daños en el hardware.
Cuando la simulación no ayuda
- Puro simulación real para la manipulación rica en contactos: La simulación no puede modelar con precisión la fricción, la deformación y la dinámica de contacto de objetos reales.
- Imágenes de cámaras simuladas como datos de formación: A pesar de los avances en la representación fotorrealista, las políticas entrenadas solo en imágenes simuladas muestran una tasa de éxito de degradación del 30
50% en cámaras reales. - Tascas que involucran objetos deformables: Las telas, la cuerda y los alimentos son extremadamente difíciles de simular con precisión. Las políticas de manipulación deformable entrenadas por Sim rara vez se transfieren a hardware real sin datos reales extensos.
Comienza la lista de verificación
Sigue estos 10 pasos para pasar de cero a una política de aprendizaje de imitación implementada:
- Elige tu hardware robot. Para un primer proyecto: ViperX-300 S2, Koch v1.1, o [OpenArm]
T9 . Presupuesto: $2,000 $8,000 para el brazo. Necesitas el control de posición a 50 Hz mínimo. - Configurar la teleoperación. El brazo del líder para obtener la mayor calidad de datos o el controlador de realidad virtual (Meta Quest 3) para obtener un coste más bajo.
- Cámaras montadas. Mínimo: 1 cámara de muñeca (Intel RealSense D405) + 1 cámara de sobrecarga (RealSense D435). Utilice monturas rígidas
Las cámaras no deben moverse entre la recogida y el despliegue. - Instale software de grabación. Utilice las herramientas de grabación de datos de LeRobot o la pila de grabación ALOHA. Verifique que la salida HDF5 incluye imágenes, posiciones conjuntas y acciones a las frecuencias correctas.
- Defina tu primera tarea. Comience con una simple: escoge un solo objeto de una ubicación fija y coloca en una zona objetivo.
- Recoge 50 demostraciones. Operador consistente, estrategia consistente. Tómate 10 minutos entre cada 20 episodios para comprobar la calidad de los datos. Rechace y vuelve a grabar los episodios malos de inmediato.
- ** Entrenamiento de su primera política de ACT.** Utilice el guión de entrenamiento de LeRobot con hiperparámetros predeterminados.
- Run 20 ensayos de evaluación. Reinicie la escena idéntica antes de cada ensayo. Graba el éxito/fallo y guarde el video de cada ensayo para el análisis de fallas.
- Diágnose de fallas y recopile datos específicos. Identifique el modo de fallas más común. Recopile 20
30 demostraciones específicamente dirigidas a ese fallo. - Iterar hasta >80% de la tasa de éxito. La mayoría de los equipos alcanzan el 80%+ en 2
3 ciclos de formación de recogida para tareas simples. Luego comienzan a expandirse a las operaciones [data flywheel] T11 ).
Preguntas frecuentes
¿Cuántas demostraciones necesito?
Para ACT en una simple tarea de pick-and-place: 50 demostraciones suelen ser suficientes para una tasa de éxito de más del 80%. Para la política de difusión: comience con 100
¿Qué tipo de acción debería elegir?
Si su tarea tiene una única estrategia clara y desea el camino más rápido para su implementación, utilice ACT. Si sus datos contienen múltiples enfoques válidos para la misma tarea (múltiples operadores, estrategias de captura ambigüas), utilice la Política de difusión. Si necesita una ejecución multicomisión con lenguaje condicionado, utilice un VLA. Cuando tengas dudas, comienza con ACT
¿Puedo usar los datos de la simulación?
Los datos de simulación por sí solos no son confiables para la manipulación rica en contactos. El enfoque más efectivo es el pre-entrenamiento de simulación + ajuste fino real: entrenar en 10.000+ episodios simulados, luego ajuste fino en 50
¿Qué hardware robótico necesito?
Como mínimo: un brazo robot con control de posición a 50 Hz (ViperX-300, Koch v1.1, OpenArm, o similar), una interfaz de teleoperación (brazo líder o controlador VR), 2
¿Cuál es la diferencia entre el aprendizaje por imitación y el aprendizaje por refuerzo?
Los trenes de aprendizaje de imitación se desarrollan a partir de demostraciones humanas. Se muestra al robot lo que debe hacer. El robot explora y aprende qué acciones maximizan la recompensa. Para la manipulación, el aprendizaje de imitación es mucho más eficiente en la muestra (50
¿Cuánto tiempo lleva el entrenamiento?
ACT en 200 episodios: 2
¿Qué formato de datos debo usar?
HDF5 es el formato estándar para los datos de demostración de robots. Almacenar posiciones conjuntas (qpos), velocidades (qvel), imágenes de cámara y acciones como conjuntos de datos separados dentro de cada archivo de episodio. Para entrenar con LeRobot, convierta al formato Parquet. Consulte nuestra guía de formato de datos (
¿Puede el aprendizaje de imitación funcionar para la manipulación móvil?
Sí, pero requiere significativamente más datos (500
Obtenga los datos de su formación recogidos por los expertos del RCSV
RCSV ofrece servicios de recogida de datos de extremo a extremo: operadores capacitados, hardware calibrado, control de calidad y entrega en su formato objetivo.
[Servicios de recopilación de datos] [







