Política de difusión frente a ACT: ¿Qué algoritmo de aprendizaje de imitación elegir?
Compare la política de difusión (DDPM de acción de la partición) con ACT (transformador CVAE de ALOHA móvil) <unk> captura multimodal, necesidades de datos, velocidad de inferencia, ajuste bimanual.
Dos de los algoritmos de aprendizaje de imitación más utilizados en la robótica moderna
Actualizado abril 2026 Acción de fragmentos con licencia MIT
[Brasar todos los modelos] [
TL;DR Política de difusión Modela la distribución multimodal de las acciones expertas a través de DDPM denonizando el estándar de oro
Por qué esta comparación es importante
Cuando recopile sus propias demostraciones de teleop
Pero tienen muy diferentes sesgos inductivos. Si eliges el equivocado para tu distribución de demostraciones, tu política se derrumbará a la media (mala) o memorizará las demostraciones (también mala). Esta página recorre cuando cada una brilla, dónde falla cada una y cómo elegir.
Comparación instantánea
| Dimension | Diffusion Policy | ACT (Action Chunking Transformer) |
|---|---|---|
| Origin | Chi et al., Columbia, RSS 2023 | Zhao et al., Stanford (Mobile ALOHA), RSS 2023 |
| Architecture | CNN or transformer backbone + conditional diffusion (DDPM) action head | ResNet visual encoder + transformer encoder-decoder with CVAE latent |
| Action representation | Chunk of future actions denoised from Gaussian noise | Chunk of future actions decoded autoregressively (or in parallel) |
| Training objective | Denoising score matching / DDPM loss | Reconstruction + KL regularizer (CVAE) |
| Typical chunk size | 8–16 steps | 50–100 steps (aggressive chunking) |
| Multi-modal capture | Strong — native to the diffusion formulation | Partial — latent captures some multi-modality but can mode-collapse |
| Data needed | ~50–200 demos for narrow tasks; more helps | ~50 demos often enough for bimanual teleop tasks |
| Training time | Slower (diffusion steps increase wall-clock) | Fast — minutes to hours on a single GPU |
| Inference speed | Needs iterative denoising; DDIM or consistency models help | Fast single forward pass; chunked execution amortizes |
| Best-known wins | Push-T, real-world manipulation with multi-modal demos (+46.9% vs prior methods) | Mobile ALOHA bimanual tasks, dexterous bimanual manipulation |
| License | MIT | MIT |
| Code | github.com/real-stanford/diffusion_policy | github.com/tonyzhaozh/act |
Política de difusión: modelado de la distribución, no de la media
La visión de la política de difusión es que las demostraciones de expertos son casi siempre multimodal. Un teleoperador humano que agarra una taza puede utilizar una captura lateral o una captura superior en diferentes ensayos; una política clásica de MSE o entropía cruzada entrenada en esos datos promediará las dos y no producirá ninguna. La política de difusión evita esto mediante el modelado de la distribución de las acciones a través de un modelo probabilístico de difusión denociante (DDPM).
El documento original de la política de difusión informó una mejora promedio del 46,9% en comparación con los métodos de aprendizaje de imitación mejores anteriores en 15 tareas, y la arquitectura se convirtió en una columna vertebral para el trabajo en aguas subyacentes como [Octo]
Cuando la política de difusión brilla
- Las demostraciones contienen múltiples estrategias válidas (tipos de agarre, direcciones de aproximación, variaciones de entrega).
- Manipulación rica en contacto en la que se componen pequeñas perturbaciones de acción
ver [guía de manipulación rica en contacto] T8 ). - Te importa la robustez a las perturbaciones y tienes presupuesto para desestimar la inferencia iterativa.
- Quieres que la política se expanda con más datos en lugar de plateauing.
El simple transformador que robó la corona bimanual
ACT fue introducido junto con el hardware bimanual Mobile ALOHA y ALOHA como la pila de aprendizaje de imitación de referencia. La arquitectura es deliberadamente simple: un ResNet codifica cada vista de la cámara, un codificador transformador las fusiona con la propriocepción, y un decodificador transformador emite una pieza de 50
La magia de ACT es la longitud de las piezas y el ensamblaje. Al predecir acciones en el futuro lejano, evita el clásico problema del "error de composición" del aprendizaje de imitación paso a paso. El resultado: en las tareas de teleop bimanual (estaclamiento de copas, vendaje de velcro, inserción de baterías), ACT tiene éxito regularmente con 50 demostraciones, mientras que una línea de base de clonación de comportamiento estándar necesitaría miles. ACT es la política de inicio para plataformas ALOHA)
Cuando ACT brilla
- Datos de teleoperación bimanual
ACT fue diseñado para esto y se muestra. - Necesitas entrenar rápido e iterar en el diseño de tareas en lugar de esperar a que la difusión converja.
- El control de la frecuencia es importante y no quieres que la denotación iterativa en tu bucle.
- Las demostraciones son relativamente consistentes (una única estrategia preferida).
Requisitos de datos
Ambas arquitecturas son eficientes en datos según los estándares modernos de VLA
Inferencia y despliegue
El paso único hacia adelante de ACT lo hace el objetivo de implementación más fácil. La ejecución de fragmentos con ensamblaje temporal se ejecuta cómodamente a 30
Compromiso honesto
La elegancia de ACT es también su límite. En tareas con demostraciones genuinamente multimodal, el CVAE de ACT puede desmoronarse en modo a la estrategia promedio, produciendo un comportamiento tímido o indeciso. Una heurística útil: si sus demostraciones son consistentes, comience con ACT; si sus demostraciones son diversas, comience con la Política de difusión. Siempre puede volver a entrenar con el otro si el primer pase decepciona.
Ambos algoritmos también son "solo" aprendizaje de imitación
Indicadores de referencia a consultar
Ambas arquitecturas aparecen en [LIBERO]
Detalles de ejecución que realmente importan
Ambos algoritmos son más simples de lo que sugieren la mayoría de los documentos de VLA, pero los detalles que determinan el éxito o el fracaso a menudo se pierden en el abstracto. Para Diffusion Policy, los tres trampas más comunes son: (1) el entrenamiento insuficiente del denoizador
Para ACT, los botones críticos son la longitud de piezas y el ganancia temporal de ensamblaje. Los trozos cortos (menos de 20 pasos) hacen que ACT se comporte como clonación de comportamiento de vainilla y reintroduca el error de composición. Los trozos muy largos (más de 200) hacen que la política sea frágil a las perturbaciones. El ALOHA por defecto de 100 pasos con ensamblaje ponderado exponencialmente es un punto de partida fuerte
Combinando las dos con una base VLA
En 2026, un número creciente de estacas de producción no eligen only ACT o only Diffusion Policy
Costo y esfuerzo de ingeniería
Ningún algoritmo es caro según los estándares modernos. Una única GPU de 24 GB (RTX 4090 o A6000) entrenará ACT o la Política de difusión en un conjunto de datos de 50 demostraciones en menos de un día. ACT generalmente converge más rápido en términos de reloj de pared porque cada paso es un único transformador hacia adelante y hacia atrás; la pérdida de múltiples pasos de la Política de difusión es más pesada pero converge en menos épocas. Se espera 4
Nuestra recomendación
Para las tareas bimanual de teleop
Lectura relacionada OpenVLA vs Octo → RT-X vs OpenVLA → Mejores modelos de VLA 2026 → Página modelo de política de difusión → Datos de ALOHA → Recolección de datos de Teleóp →
Cada VLA aquí puede ser ajustado a sus propias demostraciones.
Recoge demos → Hardware que lo ejecuta → Corre una política →







