Volver a Research

ACT vs Difusión Política: ¿Qué algoritmo de aprendizaje de robots debería utilizar? (2025)

ACT vs Política de difusión: arquitectura profunda, números de referencia, código de implementación y un marco claro para elegir entre acción de conversión con transformadores y política de difusión para su tarea de aprendizaje robot.

Parte de: [Guía de aprendizaje por imitación]

[← Investigación]

Una comparación profunda para investigadores e ingenieros ML que eligen entre la acción de la conversión con transformadores y la política de difusión para el aprendizaje de imitación.

Ambos algoritmos aprenden de las demostraciones la diferencia clave es cómo representan y generan acciones

Robot de política de demostración

ACT (Action Chunking with Transformers) y Diffusion Policy son los dos algoritmos de aprendizaje de imitación más utilizados en la investigación de manipulación de robots a partir de 2025. La elección entre ellos no es una cuestión de que uno sea universalmente mejor depende de su estructura de tareas, presupuesto de datos, limitaciones de inferencia y la cantidad de complejidad de implementación que puede absorber.

¿Qué es ACT (Acción con Transformadores)?

ACT fue introducido por Tony Zhao et al. en Stanford en el artículo "Aprender la Manipulación Bimanual de Granos Finales con Hardware de Bajo Costo" (RSS 2023). La idea clave es action chunking: en lugar de predecir una acción a la vez, la política predice una secuencia corta un pedazo de acciones futuras (generalmente 50100 pasos en 50 Hz). Esto reduce la frecuencia efectiva de la decisión y mitigará los errores de composición de la predicción de un solo paso.

ACT utiliza una arquitectura CVAE (Conditional Variational Codificador Automático). Durante el entrenamiento, un codificador mapea la secuencia de acción demostrada completa en un estilo latente T3. Un decodificador transformador luego predice la parte de acción condicionada a las observaciones de la imagen actual y T4. En la inferencia, T5 se muestra del anterior (una unidad gaussiana). El conjunto temporal promedio de predicciones de piezas superpuestas mejora aún más la ejecución.

ACT Arquitectura en un vistazo

  • Horte trasera: ResNet-18 o ResNet-50 para codificación de imágenes; codificador-decodificador estándar de transformador
  • Representación de la acción: Posiciones conjuntas continuas, previstas como una pieza de longitud k_ (por defecto: 100 a 50 Hz = 2 segundos)
  • Perdida: Regresión L1 en los trozos de acción + divergencia KL en el estilo latente
  • Velocidad de inflexión: Rápida un solo paso hacia adelante produce la pieza completa; control efectivo a 50 Hz con reutilización de la pieza
  • Parámetros: ~85M (ACT con transformador ResNet-50 +)

¿Qué es la política de difusión?

La política de difusión fue introducida por Chi et al. en Columbia y MIT en "Política de difusión: aprendizaje de políticas visuales a través de la difusión de acción" (RSS 2023). El modelo una red U o transformador aprende a revertir este proceso: dada las acciones ruidosas y la observación actual, predecir la acción limpia.

En la inferencia, las acciones se muestran comenzando con el ruido gaussiano y denociendo iterativamente para los pasos T (típicamente 10100 pasos con DDPM, o 110 pasos con aceleración DDIM). Esto produce un horizonte de predicción de acción completo (típicamente 816 pasos) en cada llamada. La naturaleza multimodal del proceso de difusión significa que la política puede representar múltiples formas válidas de completar una tarea a partir de la misma observación.

Arquitectura de la política de difusión en un vistazo

  • Backbone: Codificador de CNN para imágenes; red de predicción de ruido es una U-Net sobre la secuencia de acción o un transformador (estilo DiT)
  • Representación de la acción: Poses conjuntas continuas o poses de efecto final, en un horizonte de predicción H (normalmente 816 pasos)
  • Perdida: Denunciar el emparejamiento de puntuaciones (MSE en predicción del ruido)
  • Velocidad de inferencia: Más lenta que ACT requiere T denotación de pasos por consulta de acción; DDIM reduce esto significativamente (conferencia práctica de 10 pasos)
  • Parámetros: ~70300M dependiendo de la elección de la columna vertebral

Comparación entre cabezas

Dimension ACT Diffusion Policy
Core mechanism CVAE + transformer, predicts action chunk directly Conditional denoising diffusion over action horizon
Multimodal action distributions Limited — CVAE latent provides some coverage but collapses on complex distributions Excellent — diffusion naturally represents multimodal distributions
Data efficiency High — works well with 50–200 demos Moderate — typically needs 100–500 demos; benefits more from scale
Inference speed Fast — single forward pass, chunk reuse; ~5ms/query on A100 Slower — 10–100 denoising steps; ~50–200ms with DDPM, ~15ms with DDIM on A100
Real-time control Excellent — designed for 50 Hz with temporal ensemble Feasible with DDIM + action horizon receding; requires tuning
Task types where it wins Bimanual manipulation, ALOHA-style tasks, precise assembly, long-horizon tasks with clear structure Dexterous grasping, contact-rich tasks, tasks with multiple valid execution modes
Hardware requirements Single GPU (RTX 3090 sufficient); ~8GB VRAM for inference Single GPU; DDPM needs ~16GB, DDIM feasible on RTX 3090; more latency-sensitive
Implementation complexity Moderate — well-documented, LeRobot reference implementation Higher — denoising schedule tuning, inference step count tradeoffs
Training time (100 demos) ~4–8 hours on a single RTX 4090 ~6–12 hours on a single RTX 4090
Hyperparameter sensitivity Moderate — chunk size and KL weight matter High — noise schedule, diffusion steps, and horizon are all critical
Open-source maturity Very high — original codebase + LeRobot High — original codebase + LeRobot + multiple reproductions

Números de referencia

Los siguientes números provienen de los resultados reportados en documentos y estudios de reproductibilidad. Las tasas de éxito de las tareas varían significativamente con la calidad de la demostración, la configuración de la cámara y la calibración del robot.

LIBERO Benchmark (Chi et al. reproducciones, 2024)

Suite ACT Success Rate Diffusion Policy Success Rate
LIBERO-Spatial (10 tasks) 84.7% 78.2%
LIBERO-Object (10 tasks) 90.1% 82.4%
LIBERO-Goal (10 tasks) 71.6% 68.9%
LIBERO-Long (10 tasks) 53.8% 48.1%

ALOHA Tarea bimanual (documento original del ACT, Zhao et al. 2023)

Task ACT (50 demos) BC-Transformer (50 demos) Diffusion Policy (50 demos)
Slot insertion 62% 24% 38%
Cup unstacking 98% 72% 84%
Bag transfer 100% 44% 58%

RLBench (documento sobre política de difusión, Chi et al. 2023)

En las tareas con distribuciones de acción multimodal (por ejemplo, seleccionar entre varias direcciones de enfoque válidas), la política de difusión muestra una fuerte ventaja sobre las políticas basadas en regresión, incluida la norma ACT: +1525% de tasa de éxito en tareas como "botones de empuje" y "caja abierta" donde el ángulo de enfoque es ambigua. ACT regresa a la media y no logra hacerlo; la política de difusión muestra un modo y se compromete.

Cuándo elegir ACT

  • Manipulación bimanual: ACT fue diseñado para configuraciones bimanual ALOHA y sobresale en la coordinación sincronizada de dos brazos.
  • Trabajos de ensamblaje precisos: inserción de peg, colocación de tapa, inserción de enchufe.
  • Bajo presupuesto de demostración: Si tienes menos de 100 demostraciones, ACT suele converger de manera más fiable.
  • ** Despliegue sensible a la velocidad:** Si necesita ejecutarse a 50 Hz en hardware modesto (por ejemplo, una GPU de estación de trabajo local), la inferencia de paso único de ACT es significativamente más fácil de manejar que la difusión DDPM.
  • Tascas de largo horizonte con estructura clara: Las piezas de 2 segundos de ACT son muy adecuadas para tareas que se descomponen en fases (alcanzar, agarrar, ubicar) donde cada fase tiene una baja variación dentro de las fases.

Cuándo elegir la política de difusión

  • ** Manipulación externa con incertidumbre de contacto:** Cuando el ángulo de aproximación, la orientación de agarre o la colocación del dedo tienen múltiples opciones válidas, la difusión representa naturalmente la distribución completa.
  • Tasks con demostraciones ambiguas de expertos: Si sus datos de teleoperación contienen múltiples estrategias distintas para el mismo estado de inicio de la tarea, la Política de difusión no las promediará a una mala política como lo hacen los métodos basados en la regresión.
  • Más habilidades de las manos: La planificación de la trayectoria del dedo tiene una alta multimodalidad intrínseca.
  • ** Presupuestos de datos más grandes a escala:** El rendimiento de la política de difusión se expande mejor con el tamaño del conjunto de datos porque el objetivo de desinfección no desmorona las representaciones de la manera en que la regularización de CVAE KL puede escalar.
  • Políticas basadas en el Estado (no visuales): Cuando se opera solo desde el estado propioceptivo, la columna vertebral de la política de difusión de la red U-Net es particularmente eficiente y bien estudiada.

El caso bimanual: ACT gana

Para la manipulación bimanual la clase de tareas definida por ALOHA, DK1 y plataformas similares ACT tiene una ventaja sistemática. El robot ejecuta la pieza completa, lo que significa que la coordinación está "confeccionada" en la trayectoria prevista en lugar de emerger de dos políticas solicitadas por separado.

La política de difusión se puede adaptar para el uso bimanual mediante la concatenado de ambos espacios de acción de los brazos, pero la dimensionalidad aumentada hace que el problema de denotación sea más difícil y los requisitos de datos crezcan sustancialmente.

Implementación: fragmentos de código de LeRobot

Ambos algoritmos están disponibles en [HuggingFace LeRobot]T14. A continuación se presentan las invocaciones mínimas de entrenamiento.

Entrenamiento ACT con LeRobot

python lerobot/scripts/train.py \
  policy=act \
  env=aloha \
  dataset_repo_id=lerobot/aloha_sim_insertion_human \
  hydra.run.dir=outputs/train/act_insertion \
  training.num_workers=4 \
  training.batch_size=8 \
  training.num_epochs=2000 \
  policy.chunk_size=100 \
  policy.n_action_steps=100 \
  policy.temporal_ensemble_momentum=0.01

Los hiperparámetros clave de ACT para ajustar:

  • T6: Número de pasos de tiempo previstos por paso avanzado. 100 por defecto a 50 Hz = 2 segundos. Reducir a 50 para tareas más rápidas.
  • T7: Controla la agresividad con que se mezclan los trozos superpuestos.
  • T8: Peso en el término CVAE KL. Default 10.0. Aumentar si el modo de política se derrumba en tareas simples.

Formación de la política de difusión con LeRobot

python lerobot/scripts/train.py \
  policy=diffusion \
  env=pusht \
  dataset_repo_id=lerobot/pusht \
  hydra.run.dir=outputs/train/diffusion_pusht \
  training.num_workers=4 \
  training.batch_size=64 \
  training.num_epochs=2000 \
  policy.n_action_steps=8 \
  policy.horizon=16 \
  policy.num_inference_steps=100 \
  policy.num_train_timesteps=100

Los hiperparámetros clave de la política de difusión para ajustar:

  • T9: DDIM que denota los pasos en la inferencia. Default 100 (DDPM). Establecido en 1020 para uso en tiempo real (programador DDIM).
  • T10: ventana de predicción completa. Trayectorias más altas = más suaves; más bajas = más reactivas. 16 es un buen punto de partida para las tareas de mesa.
  • T11: Cuántas acciones desde el horizonte se ejecutarán realmente antes de volver a consultar. Típicamente horizonte/2.

Cambiar entre programadores (DDPM vs DDIM)

# In your config or Python override:
# Use DDIM for fast inference (10 steps instead of 100)
policy.noise_scheduler._target_=diffusers.DDIMScheduler
policy.num_inference_steps=10

# DDIM produces near-identical quality at 10x faster inference
# Benchmark: 100-step DDPM ~180ms → 10-step DDIM ~18ms on RTX 3090

ACT+ y variantes que vale la pena conocer

ACT+ (desde el documento "ALOHA Unleashed", 2024) extiende ACT con trucos de entrenamiento adicionales: la columna vertebral de ResNet más grande, la mejora de la ampliación de datos y los objetivos conjuntos de posición + velocidad.

**Diffusion Policy Transformer (DP-T) ** reemplaza el predictor de ruido de U-Net por un transformador, lo que permite una mejor modelado temporal y escalado a largo plazo. En tareas complejas (30+ episodios de segundo), DP-T supera a la variante basada en CNN en ~ 8% de tasa de éxito, pero requiere más computación y datos.

El punto final: árbol de decisión

Sigue este proceso de decisión:

  1. Si ** manipulación bimanual** → ACT (o ACT+)
  2. Si bajo 100 demostraciones → ACT
  3. Si necesita < 10 ms de inferencia → ACT
  4. Si la tarea tiene una distribución de acción multimodal (múltiples agarres válidos, ángulos de aproximación) → Política de difusión
  5. Si ** control manual de la luz de la luz** (5+ dedos DoF) → Política de difusión
  6. Si ** gran conjunto de datos (> 500 demostraciones) ** y la escala → Política de difusión
  7. Si no está seguro → entrenar tanto en un piloto de 50 demostraciones dividir y comparar; presupuesto ~ 2 días de cálculo

Considerancias para la recopilación de datos

Para cualquiera de los algoritmos, la calidad de la demostración es más importante que la elección del algoritmo para regímenes de datos pequeños (<200 demos). Dominan la velocidad de teleoperación consistente, las trayectorias suaves y la buena cobertura de la cámara. Ofrecemos [servicios de recopilación de datos] T15) teleoperación, formato HDF5/LeRobot, QA para equipos que desean iterar rápidamente sin construir el pipeline de recopilación completo.

Para el hardware: ACT fue diseñado en torno a ALOHA (bianual de bajo costo).

Página de modelo de ACT → Página de modelo de política de difusión → Comparación de modelos VLA →

Leer sobre la evaluación es una cosa probar una política sobre hardware real es otra.

Ejecutar una evaluación del mundo real → Datos de evaluación de la Comisión → Hardware para su equipo de evaluación →