ACT vs Difusión Política: ¿Qué algoritmo de aprendizaje de robots debería utilizar? (2025)
ACT vs Política de difusión: arquitectura profunda, números de referencia, código de implementación y un marco claro para elegir entre acción de conversión con transformadores y política de difusión para su tarea de aprendizaje robot.
Parte de: [Guía de aprendizaje por imitación]
[← Investigación]
Una comparación profunda para investigadores e ingenieros ML que eligen entre la acción de la conversión con transformadores y la política de difusión para el aprendizaje de imitación.
Ambos algoritmos aprenden de las demostraciones
Robot de política de demostración
ACT (Action Chunking with Transformers) y Diffusion Policy son los dos algoritmos de aprendizaje de imitación más utilizados en la investigación de manipulación de robots a partir de 2025. La elección entre ellos no es una cuestión de que uno sea universalmente mejor
¿Qué es ACT (Acción con Transformadores)?
ACT fue introducido por Tony Zhao et al. en Stanford en el artículo "Aprender la Manipulación Bimanual de Granos Finales con Hardware de Bajo Costo" (RSS 2023). La idea clave es action chunking: en lugar de predecir una acción a la vez, la política predice una secuencia corta
ACT utiliza una arquitectura CVAE (Conditional Variational Codificador Automático). Durante el entrenamiento, un codificador mapea la secuencia de acción demostrada completa en un estilo latente
ACT Arquitectura en un vistazo
- Horte trasera: ResNet-18 o ResNet-50 para codificación de imágenes; codificador-decodificador estándar de transformador
- Representación de la acción: Posiciones conjuntas continuas, previstas como una pieza de longitud k_ (por defecto: 100 a 50 Hz = 2 segundos)
- Perdida: Regresión L1 en los trozos de acción + divergencia KL en el estilo latente
- Velocidad de inflexión: Rápida
un solo paso hacia adelante produce la pieza completa; control efectivo a 50 Hz con reutilización de la pieza - Parámetros: ~85M (ACT con transformador ResNet-50 +)
¿Qué es la política de difusión?
La política de difusión fue introducida por Chi et al. en Columbia y MIT en "Política de difusión: aprendizaje de políticas visuales a través de la difusión de acción" (RSS 2023). El modelo
En la inferencia, las acciones se muestran comenzando con el ruido gaussiano y denociendo iterativamente para los pasos T (típicamente 10
Arquitectura de la política de difusión en un vistazo
- Backbone: Codificador de CNN para imágenes; red de predicción de ruido es una U-Net sobre la secuencia de acción o un transformador (estilo DiT)
- Representación de la acción: Poses conjuntas continuas o poses de efecto final, en un horizonte de predicción H (normalmente 8
16 pasos) - Perdida: Denunciar el emparejamiento de puntuaciones (MSE en predicción del ruido)
- Velocidad de inferencia: Más lenta que ACT
requiere T denotación de pasos por consulta de acción; DDIM reduce esto significativamente (conferencia práctica de 10 pasos) - Parámetros: ~70
300M dependiendo de la elección de la columna vertebral
Comparación entre cabezas
| Dimension | ACT | Diffusion Policy |
|---|---|---|
| Core mechanism | CVAE + transformer, predicts action chunk directly | Conditional denoising diffusion over action horizon |
| Multimodal action distributions | Limited — CVAE latent provides some coverage but collapses on complex distributions | Excellent — diffusion naturally represents multimodal distributions |
| Data efficiency | High — works well with 50–200 demos | Moderate — typically needs 100–500 demos; benefits more from scale |
| Inference speed | Fast — single forward pass, chunk reuse; ~5ms/query on A100 | Slower — 10–100 denoising steps; ~50–200ms with DDPM, ~15ms with DDIM on A100 |
| Real-time control | Excellent — designed for 50 Hz with temporal ensemble | Feasible with DDIM + action horizon receding; requires tuning |
| Task types where it wins | Bimanual manipulation, ALOHA-style tasks, precise assembly, long-horizon tasks with clear structure | Dexterous grasping, contact-rich tasks, tasks with multiple valid execution modes |
| Hardware requirements | Single GPU (RTX 3090 sufficient); ~8GB VRAM for inference | Single GPU; DDPM needs ~16GB, DDIM feasible on RTX 3090; more latency-sensitive |
| Implementation complexity | Moderate — well-documented, LeRobot reference implementation | Higher — denoising schedule tuning, inference step count tradeoffs |
| Training time (100 demos) | ~4–8 hours on a single RTX 4090 | ~6–12 hours on a single RTX 4090 |
| Hyperparameter sensitivity | Moderate — chunk size and KL weight matter | High — noise schedule, diffusion steps, and horizon are all critical |
| Open-source maturity | Very high — original codebase + LeRobot | High — original codebase + LeRobot + multiple reproductions |
Números de referencia
Los siguientes números provienen de los resultados reportados en documentos y estudios de reproductibilidad. Las tasas de éxito de las tareas varían significativamente con la calidad de la demostración, la configuración de la cámara y la calibración del robot.
LIBERO Benchmark (Chi et al. reproducciones, 2024)
| Suite | ACT Success Rate | Diffusion Policy Success Rate |
|---|---|---|
| LIBERO-Spatial (10 tasks) | 84.7% | 78.2% |
| LIBERO-Object (10 tasks) | 90.1% | 82.4% |
| LIBERO-Goal (10 tasks) | 71.6% | 68.9% |
| LIBERO-Long (10 tasks) | 53.8% | 48.1% |
ALOHA Tarea bimanual (documento original del ACT, Zhao et al. 2023)
| Task | ACT (50 demos) | BC-Transformer (50 demos) | Diffusion Policy (50 demos) |
|---|---|---|---|
| Slot insertion | 62% | 24% | 38% |
| Cup unstacking | 98% | 72% | 84% |
| Bag transfer | 100% | 44% | 58% |
RLBench (documento sobre política de difusión, Chi et al. 2023)
En las tareas con distribuciones de acción multimodal (por ejemplo, seleccionar entre varias direcciones de enfoque válidas), la política de difusión muestra una fuerte ventaja sobre las políticas basadas en regresión, incluida la norma ACT: +15
Cuándo elegir ACT
- Manipulación bimanual: ACT fue diseñado para configuraciones bimanual ALOHA y sobresale en la coordinación sincronizada de dos brazos.
- Trabajos de ensamblaje precisos: inserción de peg, colocación de tapa, inserción de enchufe.
- Bajo presupuesto de demostración: Si tienes menos de 100 demostraciones, ACT suele converger de manera más fiable.
- ** Despliegue sensible a la velocidad:** Si necesita ejecutarse a 50 Hz en hardware modesto (por ejemplo, una GPU de estación de trabajo local), la inferencia de paso único de ACT es significativamente más fácil de manejar que la difusión DDPM.
- Tascas de largo horizonte con estructura clara: Las piezas de 2 segundos de ACT son muy adecuadas para tareas que se descomponen en fases (alcanzar, agarrar, ubicar) donde cada fase tiene una baja variación dentro de las fases.
Cuándo elegir la política de difusión
- ** Manipulación externa con incertidumbre de contacto:** Cuando el ángulo de aproximación, la orientación de agarre o la colocación del dedo tienen múltiples opciones válidas, la difusión representa naturalmente la distribución completa.
- Tasks con demostraciones ambiguas de expertos: Si sus datos de teleoperación contienen múltiples estrategias distintas para el mismo estado de inicio de la tarea, la Política de difusión no las promediará a una mala política como lo hacen los métodos basados en la regresión.
- Más habilidades de las manos: La planificación de la trayectoria del dedo tiene una alta multimodalidad intrínseca.
- ** Presupuestos de datos más grandes a escala:** El rendimiento de la política de difusión se expande mejor con el tamaño del conjunto de datos porque el objetivo de desinfección no desmorona las representaciones de la manera en que la regularización de CVAE KL puede escalar.
- Políticas basadas en el Estado (no visuales): Cuando se opera solo desde el estado propioceptivo, la columna vertebral de la política de difusión de la red U-Net es particularmente eficiente y bien estudiada.
El caso bimanual: ACT gana
Para la manipulación bimanual
La política de difusión se puede adaptar para el uso bimanual mediante la concatenado de ambos espacios de acción de los brazos, pero la dimensionalidad aumentada hace que el problema de denotación sea más difícil y los requisitos de datos crezcan sustancialmente.
Implementación: fragmentos de código de LeRobot
Ambos algoritmos están disponibles en [HuggingFace LeRobot]
Entrenamiento ACT con LeRobot
python lerobot/scripts/train.py \
policy=act \
env=aloha \
dataset_repo_id=lerobot/aloha_sim_insertion_human \
hydra.run.dir=outputs/train/act_insertion \
training.num_workers=4 \
training.batch_size=8 \
training.num_epochs=2000 \
policy.chunk_size=100 \
policy.n_action_steps=100 \
policy.temporal_ensemble_momentum=0.01
Los hiperparámetros clave de ACT para ajustar:
T6 : Número de pasos de tiempo previstos por paso avanzado. 100 por defecto a 50 Hz = 2 segundos. Reducir a 50 para tareas más rápidas. T7 : Controla la agresividad con que se mezclan los trozos superpuestos. T8 : Peso en el término CVAE KL. Default 10.0. Aumentar si el modo de política se derrumba en tareas simples.
Formación de la política de difusión con LeRobot
python lerobot/scripts/train.py \
policy=diffusion \
env=pusht \
dataset_repo_id=lerobot/pusht \
hydra.run.dir=outputs/train/diffusion_pusht \
training.num_workers=4 \
training.batch_size=64 \
training.num_epochs=2000 \
policy.n_action_steps=8 \
policy.horizon=16 \
policy.num_inference_steps=100 \
policy.num_train_timesteps=100
Los hiperparámetros clave de la política de difusión para ajustar:
T9 : DDIM que denota los pasos en la inferencia. Default 100 (DDPM). Establecido en 10 20 para uso en tiempo real (programador DDIM). T10 : ventana de predicción completa. Trayectorias más altas = más suaves; más bajas = más reactivas. 16 es un buen punto de partida para las tareas de mesa. T11 : Cuántas acciones desde el horizonte se ejecutarán realmente antes de volver a consultar. Típicamente horizonte/2.
Cambiar entre programadores (DDPM vs DDIM)
# In your config or Python override:
# Use DDIM for fast inference (10 steps instead of 100)
policy.noise_scheduler._target_=diffusers.DDIMScheduler
policy.num_inference_steps=10
# DDIM produces near-identical quality at 10x faster inference
# Benchmark: 100-step DDPM ~180ms → 10-step DDIM ~18ms on RTX 3090
ACT+ y variantes que vale la pena conocer
ACT+ (desde el documento "ALOHA Unleashed", 2024) extiende ACT con trucos de entrenamiento adicionales: la columna vertebral de ResNet más grande, la mejora de la ampliación de datos y los objetivos conjuntos de posición + velocidad.
**Diffusion Policy Transformer (DP-T) ** reemplaza el predictor de ruido de U-Net por un transformador, lo que permite una mejor modelado temporal y escalado a largo plazo. En tareas complejas (30+ episodios de segundo), DP-T supera a la variante basada en CNN en ~ 8% de tasa de éxito, pero requiere más computación y datos.
El punto final: árbol de decisión
Sigue este proceso de decisión:
- Si ** manipulación bimanual** → ACT (o ACT+)
- Si bajo 100 demostraciones → ACT
- Si necesita < 10 ms de inferencia → ACT
- Si la tarea tiene una distribución de acción multimodal (múltiples agarres válidos, ángulos de aproximación) → Política de difusión
- Si ** control manual de la luz de la luz** (5+ dedos DoF) → Política de difusión
- Si ** gran conjunto de datos (> 500 demostraciones) ** y la escala → Política de difusión
- Si no está seguro → entrenar tanto en un piloto de 50 demostraciones dividir y comparar; presupuesto ~ 2 días de cálculo
Considerancias para la recopilación de datos
Para cualquiera de los algoritmos, la calidad de la demostración es más importante que la elección del algoritmo para regímenes de datos pequeños (<200 demos). Dominan la velocidad de teleoperación consistente, las trayectorias suaves y la buena cobertura de la cámara. Ofrecemos [servicios de recopilación de datos]
Para el hardware: ACT fue diseñado en torno a ALOHA (bianual de bajo costo).
Página de modelo de ACT → Página de modelo de política de difusión → Comparación de modelos VLA →
Leer sobre la evaluación es una cosa
Ejecutar una evaluación del mundo real → Datos de evaluación de la Comisión → Hardware para su equipo de evaluación →







