Volver a Blog

ACT vs. Política de difusión: Guía práctica para elegir el algoritmo correcto

Cuándo utilizar el Acción de Chunking con Transformadores (ACT) vs. Política de difusión para la manipulación de robots <unk> latencia, complejidad de tareas y compensaciones de datos de entrenamiento.

Parte de: [Guía de aprendizaje por imitación]

[← Blog] T2)

La elección del algoritmo importa menos que la calidad de los datos, pero es lo suficientemente importante para hacerlo bien.

Resumen rápido

ACT (Action Chunking with Transformers, Zhao et al. 2023) utiliza un CVAE para producir un par de acciones secuencias de 20-100 acciones futuras previstas a la vez. Es rápido (50 ms de inferencia en una sola GPU), determinista dado una muestra latente, y funciona bien con 50-500 demostraciones. Diffusion Policy (Chi et al. 2023) utiliza un modelo de difusión conditional denoising sobre el espacio de acción. Es más lento (200-500 ms con DDPM, 50 ms con destilación de consistencia), explícitamente multi-modal y maneja mejor tareas de precisión y tareas de múltiples pasos con más datos.

La latencia de la inferencia: la limitación práctica

Para el control en tiempo real de los robots, la latencia de inferencia es una dura restricción que a menudo determina la elección del algoritmo antes de cualquier otra consideración.

Algorithm Inference Time Control Hz Notes
ACT 50 ms 20 Hz Executes 20-step chunks; real inference rate much lower
Diffusion Policy (DDPM) 500 ms 2 Hz Too slow for reactive tasks without chunking
Diffusion Policy (DDIM 10 steps) 200 ms 5 Hz Acceptable for slow manipulation
Consistency Policy 50 ms 20 Hz Single denoising step; matches ACT latency
ACT + temporal ensemble 50 ms 20 Hz Smoothing across multiple chunk predictions

Si su tarea requiere un control reactivo de alta frecuencia (captura, vertido, montaje de alta velocidad), la DDPM de política de difusión estándar es simplemente demasiado lenta. Utilice la política de ACT o de consistencia.

Recomendaciones sobre el tipo de tarea

  • Tascas de reacción rápida (captura, agitación, pick-up de alta velocidad): ACT o Política de consistencia. La velocidad de control de 20Hz permite la adaptación en tiempo real.
  • Tascas de precisión con múltiples soluciones viables (peg-in-hole, inserción USB, plegado de tela): Política de difusión. Su multiplicidad explícita le permite modelar la distribución sobre estrategias de captura exitosas, no solo la media que es crítica para las tareas de precisión donde la estrategia media a menudo falla.
  • Tascas de largo horizonte en 10 pasos: Ninguno de los algoritmos por sí solo es suficiente. Utilice políticas jerárquicas: un planificador de tareas selecciona las secuencias de subtareas, luego ACT o Política de difusión ejecuta las subtareas individuales.
  • Tascas en las que la posición del objeto varía significativamente: Ambos funcionan, pero la política de difusión tiende a generalizar mejor las nuevas posiciones del objeto cuando se entrenan con datos suficientes.

Requisitos de datos de formación

Algorithm Minimum Demos Recommended Training Time (single GPU)
ACT 50 100–500 2–4 hours
Diffusion Policy (DDPM) 200 500–2000 6–12 hours
Consistency Policy 100 300–1000 4–8 hours

El requisito de datos más bajo de ACT es una ventaja real para la exploración de nuevas tareas donde recoger más de 500 demos es costoso. Sin embargo, la Política de difusión a menudo alcanza y supera a ACT cuando hay más datos disponibles particularmente para tareas de precisión. Si tiene un presupuesto de datos superior a 1.000 demostraciones, evalúe seriamente la Política de difusión.

Sensibilidad de los hiperparámetros

El hiperparámetro crítico de ACT es el peso de divergencia KL en la pérdida de CVAE. Demasiado bajo: el espacio latente se desploma y la política ignora el contexto. Demasiado alto: la política ignora las demostraciones y regresa a la media. Recomendación estándar: comenzar a 10 y barrer 1, 5, 10, 50 en un conjunto de datos pequeño antes de la formación completa.

La política de difusión es más sensible a la programación de la tasa de aprendizaje y la programación de variación de ruido. La implementación original de DDPM utiliza un programa de ruido cosino con LR de calentamiento lineal; estos valores predeterminados funcionan bien en la práctica. El error más común es el uso de una tasa de aprendizaje demasiado alta (> 3e-4 con Adam), lo que causa inestabilidad de la formación en datos ricos en contactos.

Matriz de decisión

Condition Recommended Algorithm
< 200 demos available ACT
Reactive/high-speed task ACT or Consistency Policy
Precisión with multi-modal solutions Diffusion Policy
> 500 demos, slow task Diffusion Policy
Deployment on low-compute hardware ACT (lighter model)
Want to use HuggingFace LeRobot Both supported

Ambos algoritmos están disponibles como implementaciones de referencia en la RCSV [plataforma de datos] (T3), con configuraciones de entrenamiento preconstruidas para OpenArm 1 y configuraciones de cámaras comunes.

Bajo la capucha: ACT Arquitectura

ACT (Action Chunking with Transformers) combina un CVAE (Conditional Variational Codificador Automático) con una arquitectura de transformador para predecir los trozos de acción - secuencias de 20-100 acciones futuras a partir de una sola observación.

Encodificador: El codificador visual procesa las imágenes de la cámara a través de una columna vertebral pre-entrenada (típicamente ResNet-18 o una variante ViT).

CVAE: Durante el entrenamiento, el codificador CVAE toma la secuencia de acción de la verdad de base y la observación para producir una variable latente z. Durante la inferencia, z se muestra del anterior aprendido (condicionado solo en la observación). El plazo de divergencia KL en la pérdida de CVAE garantiza que las distribuciones anteriores y posteriores permanezcan cercanas, lo que permite tomar muestras de las anteriores en el momento del ensayo.

** Decodificador:** El decodificador transformador toma el contexto de incorporación y el z latente y genera autoregresivamente la pieza de acción. Cada posición de salida predice una acción (típicamente 7D: 6D delta de efecto final + 1D agarre). La pieza completa se genera en un solo paso hacia adelante (no iterativamente como las fichas de modelo de lenguaje), por lo que ACT logra la inferencia de 50 ms.

** Ensamble temporal:** Al desplegar, ACT genera trozos de acción superpuestos en cada paso de reobservación y promedia las acciones predicidas superpuestas con ponderación exponencial (predicciones recientes pesadas más). Esto suaviza las transiciones entre trozos y reduce el nerviosismo en los límites de los trozos. El parámetro de desintegración del peso del conjunto (normalmente 0,01) controla la compensación entre la suavidad y la capacidad de respuesta.

Bajo la capucha: Arquitectura de la política de difusión

La política de difusión aplica el marco DDPM (Denoising Diffusion Probabilistic Model) a la predicción de la acción del robot. En lugar de generar imágenes a partir del ruido (como en los modelos de difusión de imágenes), genera secuencias de acción a partir del ruido.

** Proceso avanzado:** Durante el entrenamiento, el ruido se añade progresivamente a la secuencia de acción de la verdad de la tierra sobre los pasos de difusión T (típicamente T=100 para DDPM). En el paso T, la acción es ruido gaussiano puro. El modelo aprende a revertir este proceso: dado el ruido en el paso t y la observación, predecir el ruido que se agregó (predicción de epsilon) o la acción limpia directamente.

Arquitectura de red: La red de denotación puede ser una U-Net 1D (convolutiva, que opera sobre la dimensión temporal de la secuencia de acción) o un transformador. La variante U-Net es la original y más probada; la variante transformadora (DP-T, Transformador de Política de Difusión) está ganando adopción por sus mejores propiedades de escala. Ambos toman como entrada: la secuencia de acción ruidosa, el paso de tiempo de difusión t (codizado como una incorporación sinusoidal) y la codificación de observación desde la columna vertebral visual.

Inferencia: A partir del ruido puro, el modelo denota iterativamente sobre T pasos para producir una secuencia de acción limpia. La destilación de coherencia desmorona todo el proceso de denotación en un solo paso, coincidiendo con la velocidad de inferencia de ACT a costa de una complejidad adicional de entrenamiento.

Multi-modalidad: La ventaja principal de la política de difusión sobre ACT es el modelado explícito de la distribución de acción multimodal. Cuando una tarea tiene múltiples estrategias válidas (enfoque de izquierda contra derecha, captura de arriba contra lado), el modelo de difusión puede representar todos los modos válidos en la distribución aprendida. El CVAE de ACT también puede representar múltiples modos a través del espacio latente, pero la regularización de KL tiende a colapsar los modos en la práctica, especialmente con datos de entrenamiento limitados.

Los enfoques híbridos: combinar la política de ACT y la política de difusión

Se han desarrollado varios enfoques híbridos que combinan las fortalezas de ambos algoritmos:

  • DP-T (Transformador de Política de Difusión): reemplaza la red de denotación de U-Net con un transformador, obteniendo una mejor escalabilidad con la longitud de la secuencia de acción y la complejidad de la observación. DP-T con deducción en 10 pasos DDIM logra una latencia de 100 ms (entre ACT y DP estándar) con predicción de acción multimodal. Esta es cada vez más la opción predeterminada para los equipos con suficiente computación.
  • ** Política de Consistencia:** Destila una política de difusión entrenada en un generador de un solo paso utilizando la formación de consistencia. El resultado coincide con la inferencia de 50 ms de ACT mientras se conserva la distribución de acción multimodal de la política de difusión.
  • ** ACT con predicción de múltiples cabezas:** En lugar de un solo decodificador CVAE, utilice cabezas de decodificador K que cada una prediga una pieza de acción diferente. En la inferencia, seleccione la cabeza cuyo pieza de reconstrucción prevista tiene el error de reconstrucción más bajo en comparación con la observación más reciente. Esto proporciona una discreta multi-modalidad (modos K) a la velocidad de inferencia a nivel ACT. Los valores prácticos de K son 3-5.
  • ** DP + ACT jerárquico:** Utilice la política de difusión para la selección de habilidades de alto nivel (que captan la estrategia, que se acercan a la dirección) a baja frecuencia (1-2 Hz), y ACT para la ejecución de trayectorias de bajo nivel a alta frecuencia (20 Hz). Esto combina la planificación multimodale de DP con el control reactivo rápido de ACT.

Indicadores de referencia de inferencia por plataforma de hardware

El hardware de implementación determina qué algoritmo es viable. Estos puntos de referencia utilizan los tamaños estándar del modelo (ACT: ResNet-18 backbone + 4 layer transformator, ~25M params; Política de difusión: ResNet-18 + 1D U-Net, ~55M params; Política de consistencia: la misma arquitectura que DP, destilada a un solo paso).

Algorithm RTX 4090 RTX 3060 Jetson Orin (64GB) Jetson Orin Nano Apple M2 (MPS) CPU (i7-13700)
ACT (chunk=50) 12 ms / 83 Hz 35 ms / 28 Hz 50 ms / 20 Hz 120 ms / 8 Hz 65 ms / 15 Hz 180 ms / 5.5 Hz
ACT (chunk=100) 18 ms / 55 Hz 50 ms / 20 Hz 75 ms / 13 Hz 180 ms / 5.5 Hz 95 ms / 10 Hz 280 ms / 3.5 Hz
DP (DDPM, 100 steps) 150 ms / 6.6 Hz 420 ms / 2.4 Hz 600 ms / 1.7 Hz 1800 ms / 0.6 Hz 550 ms / 1.8 Hz 4200 ms / 0.2 Hz
DP (DDIM, 10 steps) 22 ms / 45 Hz 65 ms / 15 Hz 100 ms / 10 Hz 280 ms / 3.6 Hz 85 ms / 12 Hz 650 ms / 1.5 Hz
DP-T (DDIM, 10 steps) 28 ms / 35 Hz 80 ms / 12.5 Hz 120 ms / 8 Hz 350 ms / 2.9 Hz 105 ms / 9.5 Hz 820 ms / 1.2 Hz
Consistency Policy 15 ms / 66 Hz 45 ms / 22 Hz 70 ms / 14 Hz 200 ms / 5 Hz 60 ms / 16 Hz 350 ms / 2.9 Hz

** Observaciones clave:** La política de difusión de DDPM es inutilizable en cualquier cosa por debajo de una GPU de escritorio. DDIM con 10 pasos trae DP en territorio práctico en Jetson Orin (10 Hz es suficiente para la mayoría de las tareas de manipulación). ACT es el único algoritmo que se ejecuta a una velocidad aceptable en Jetson Orin Nano (8 Hz con chunk=50). La Política de Consistencia coincide con la velocidad de ACT mientras se conservan las propiedades multimodal de DP, lo que la convierte en la mejor opción en el hardware de gama media, si puedes permitirte el tiempo de entrenamiento adicional.

Para robots móviles (Unitree G1, plataformas Mobile ALOHA en RCSV), Jetson Orin es el módulo de computación estándar. Esto significa que sus opciones prácticas son ACT, DDIM DP o Política de Consistencia.

Comparación de la eficiencia de la formación

El costo de la capacitación depende del tamaño del conjunto de datos, el hardware de la GPU y el algoritmo. Estos puntos de referencia utilizan una configuración estándar: entrada de 2 cámaras (224x224), espacio de acción de 7 DOF, GPU NVIDIA única.

Scenario ACT (A100) ACT (RTX 3060) DP (A100) DP (RTX 3060) CP (A100)
100 demos, 2K epochs 45 min 2.5 hr 2 hr 8 hr 4 hr*
500 demos, 2K epochs 3 hr 12 hr 8 hr 36 hr 16 hr*
2000 demos, 3K epochs 18 hr 72 hr 48 hr 8+ days 96 hr*
Cloud cost estimate (above) $35 N/A (local) $95 N/A (local) $190*

*La formación de política de coherencia incluye la formación base DP + destilación de coherencia.

ACT se ejecuta 3-4 veces más rápido que la Política de difusión para el mismo tamaño del conjunto de datos, lo que importa significativamente durante la creación de prototipos rápidos cuando se iteran en la estrategia de recopilación de datos e hiperparámetros. En 500 demostraciones en un RTX local 3060, es decir, 5-10 días de entrenamiento para ACT vs 15-30 días para DP. Esto solo justifica comenzar con ACT para la exploración inicial de tareas, luego cambiar a DP una vez que la recopilación de datos se finalice y desea el máximo rendimiento.

Comparación de tasas de éxito por nivel de tarea

Números en bruto de evaluaciones publicadas y benchmarks internos de RCSV en OpenArm 1 + RealSense D435i. Todas las políticas entrenadas en el mismo conjunto de datos de demostración para cada tarea. Éxito = tarea completada dentro de 2x el tiempo de demostración.

Task Demos ACT DP (DDIM) CP Winner
Pick cube (single position) 50 92% 85% 88% ACT
Pick cube (random position) 200 78% 84% 82% DP
Peg insertion (tight fit, 1mm) 300 55% 72% 68% DP
Bimanual handover 200 75% 70% 72% ACT
Cloth folding 500 40% 62% 58% DP
Pour liquid (speed-critical) 150 68% 52% 65% ACT
Stack 3 blocks (sequential) 400 35% 48% 45% DP

** Patrón:** ACT gana en tareas que requieren velocidad (versión, transferencia) y con pequeños conjuntos de datos (pick de posición única con 50 demos). DP gana en tareas de precisión (inserción de peg), tareas con alta variación (posiciones aleatorias, plegado de tela) y tareas de horizonte más largo (estaclamiento de bloques). La brecha se reduce a medida que aumenta el tamaño del conjunto de datos.

Los modos de falla y el desmarcado comunes

Ambos algoritmos fallan de manera predecible. Reconocer el patrón de falla le dice si la solución es más datos, diferentes hiperparámetros o un algoritmo completamente diferente.

Las fallas específicas del ACT

  • Modo promedio (oscilación de jerky cerca del contacto): La política promedia dos estrategias válidas (enfoque de izquierda vs derecha) que producen una trayectoria que no va a ninguna parte.
  • Discontinuidades de los límites de los trozos (tirones repentinos cada N pasos): El conjunto temporal no se suaviza lo suficiente entre los trozos consecutivos.
  • Drift en tareas largas (> 15 segundos): ACT no tiene un mecanismo explícito para corregir el error acumulado en horizontes largos. La política predice los trozos de circuito abierto que lentamente divergen de la trayectoria prevista.

Las fallas específicas de la política de difusión

  • Reacción lenta a la perturbación: Con el DDPM de 100 pasos, la política no puede reaccionar a eventos inesperados (deslizamientos de objetos, intervención humana) durante 500 ms. Corrección: cambiar a DDIM de 10 pasos o Política de Consistencia. Para las subtareas reactivas, utilice una arquitectura híbrida con ACT para el componente reactivo.
  • ** Colapso de entrenamiento (picos de pérdida, gradientes NaN):** Común con tasas de aprendizaje superiores a 3e-4 o tamaños de lote inferiores a 32.
  • Tracetorias demasiado suaves (el pegatín se abre/clieve demasiado lentamente): El proceso de denodificación de difusión suaviza naturalmente la distribución de la acción, lo que puede redondear las transiciones de pegatín agudas.

Optimización de las exportaciones y tensores de ONNX

Para el despliegue en el hardware de borde, tanto ACT como DP se benefician significativamente de la optimización de exportación de ONNX y TensorRT.

# export_act_onnx.py -- Export ACT a ONNX para TensorRT importar antorcha de lerobot.common.policies.act.modeling_act import ACTPolicy # Load trained checkpoint policy = ACTPolicy.from_pretrained("path/to/checkpoint") policy.eval() #Crear entradas de maniobra que coincidan con tu espacio de observación dummy_obs = { "observación.images.top": torch.randn(1, 3, 224, 224), "observación.images.wrist": torch. \n(1, 3, 224, 224), "observación.state": torch.randn1, 14), # 7-DOF combinar xset de acción } #Exportar a NX.ch.ch.conch.conch.conch.conch.conch", \\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\

La optimización de TensorRT FP16 generalmente proporciona una velocidad de 2-3x sobre PyTorch en el hardware Jetson. Para ACT en Jetson Orin, esto trae inferencias de 50 ms a 18-22 ms. Para DDIM DP, de 100 ms a 35-45 ms. La cuantización de FP16 tiene un impacto insignificante en la calidad de la política para ambos algoritmos (menos de 1% de la tasa de éxito de caída en nuestras pruebas).

Consejos de entrenamiento para ambos algoritmos

# Common training configuration patterns for LeRobot

# ACT config (lerobot/configs/policy/act.yaml)
# Key hyperparameters to tune:
#   chunk_size: 50-100 (longer = smoother but less reactive)
#   kl_weight: 10 (sweep: 1, 5, 10, 50)
#   lr: 1e-4 (reduce to 5e-5 if training is unstable)
#   batch_size: 32-64
#   n_epochs: 2000 (for 200 demos; scale proportionally)

# Diffusion Policy config (lerobot/configs/policy/diffusion.yaml)
# Key hyperparameters:
#   n_diffusion_steps: 100 (DDPM) or 10 (DDIM at inference)
#   prediction_type: "epsilon" (noise prediction; more stable than "sample")
#   lr: 1e-4 with cosine schedule
#   batch_size: 64-128 (DP benefits from larger batches more than ACT)
#   n_epochs: 3000 (for 200 demos; DP converges slower than ACT)

# Both algorithms:
#   - Use action normalization (zero mean, unit variance per dimension)
#   - Use image augmentation (random crop 84-96%, color jitter)
#   - Monitor validation loss every 50 epochs; save best checkpoint
#   - EMA (exponential moving average) of weights at 0.9999 decay

Lectura relacionada

  • [Aprendizaje por imitación para robots: desde las demostraciones hasta la implementación]
  • [Marco LeRobot: Guía para comenzar]
  • [Generalización de la política de robots: por qué su robot falla en nuevos objetos]
  • [Leyes de escala para el aprendizaje de robots: lo que sabemos en 2026]
  • [Aprendizaje robótico: costo por análisis de demostración]
  • [Servicios de recogida de datos de la RCSV]
  • [Plataforma de datos de la RCSV]

Entrenar su primera política sobre infraestructura de RCSV

La plataforma RCSV proporciona configuraciones de capacitación preconstruidas de ACT y de políticas de difusión, gestión de conjuntos de datos y herramientas de evaluación.

[Explora la plataforma]