Volver a VLA Models

Política de difusión frente a ACT: ¿Qué algoritmo de aprendizaje de imitación elegir?

Compare la política de difusión (DDPM de acción de la partición) con ACT (transformador CVAE de ALOHA móvil) <unk> captura multimodal, necesidades de datos, velocidad de inferencia, ajuste bimanual.

Dos de los algoritmos de aprendizaje de imitación más utilizados en la robótica moderna uno basado en la denociación de la difusión, el otro en un transformador CVAE del proyecto Mobile ALOHA. ¿Cuál captura mejor sus demostraciones de teleop?

Actualizado abril 2026 Acción de fragmentos con licencia MIT

[Brasar todos los modelos] [T0] [Recolectar datos de demostración] [T1]

TL;DR Política de difusión Modela la distribución multimodal de las acciones expertas a través de DDPM denonizando el estándar de oro cuando las demostraciones muestran "múltiples formas válidas" de realizar una tarea. ACT (Action Chunking Transformer) de Mobile ALOHA utiliza un transformador CVAE que predice trozos de acciones futuras condicionadas a una aprendizaje latente muerto simple, trenes rápidos, y brilla en datos bimanual de teleop. La política de difusión gana con la robustez multimodal; ACT gana con la simplicidad, la velocidad de entrenamiento y el ajuste bimanual.

Por qué esta comparación es importante

Cuando recopile sus propias demostraciones de teleop en un [OpenArm]T2), [ALOHA]T3), o [Unitree G1]T4) se entrenará en la Política de Difusión o ACT mucho antes de tocar un VLA fundacional. Estas dos arquitecturas definen el estándar actual para el aprendizaje de imitación pura: ambas utilizan el chunking de acción, ambas están licenciadas por MIT, ambas tienen implementaciones de referencia en [LeRobot] ((T5), y ambas son citadas rutinariamente como líneas de base en los documentos de aprendizaje de robots 20242026.

Pero tienen muy diferentes sesgos inductivos. Si eliges el equivocado para tu distribución de demostraciones, tu política se derrumbará a la media (mala) o memorizará las demostraciones (también mala). Esta página recorre cuando cada una brilla, dónde falla cada una y cómo elegir.

Comparación instantánea

Dimension Diffusion Policy ACT (Action Chunking Transformer)
Origin Chi et al., Columbia, RSS 2023 Zhao et al., Stanford (Mobile ALOHA), RSS 2023
Architecture CNN or transformer backbone + conditional diffusion (DDPM) action head ResNet visual encoder + transformer encoder-decoder with CVAE latent
Action representation Chunk of future actions denoised from Gaussian noise Chunk of future actions decoded autoregressively (or in parallel)
Training objective Denoising score matching / DDPM loss Reconstruction + KL regularizer (CVAE)
Typical chunk size 8–16 steps 50–100 steps (aggressive chunking)
Multi-modal capture Strong — native to the diffusion formulation Partial — latent captures some multi-modality but can mode-collapse
Data needed ~50–200 demos for narrow tasks; more helps ~50 demos often enough for bimanual teleop tasks
Training time Slower (diffusion steps increase wall-clock) Fast — minutes to hours on a single GPU
Inference speed Needs iterative denoising; DDIM or consistency models help Fast single forward pass; chunked execution amortizes
Best-known wins Push-T, real-world manipulation with multi-modal demos (+46.9% vs prior methods) Mobile ALOHA bimanual tasks, dexterous bimanual manipulation
License MIT MIT
Code github.com/real-stanford/diffusion_policy github.com/tonyzhaozh/act

Política de difusión: modelado de la distribución, no de la media

La visión de la política de difusión es que las demostraciones de expertos son casi siempre multimodal. Un teleoperador humano que agarra una taza puede utilizar una captura lateral o una captura superior en diferentes ensayos; una política clásica de MSE o entropía cruzada entrenada en esos datos promediará las dos y no producirá ninguna. La política de difusión evita esto mediante el modelado de la distribución de las acciones a través de un modelo probabilístico de difusión denociante (DDPM).

El documento original de la política de difusión informó una mejora promedio del 46,9% en comparación con los métodos de aprendizaje de imitación mejores anteriores en 15 tareas, y la arquitectura se convirtió en una columna vertebral para el trabajo en aguas subyacentes como [Octo]T7) y la política de difusión 3D. El costo es inferencia: una implementación ingenua ejecuta pasos de difusión K por pieza, que puede empujar los bucles de control por debajo de 10 Hz. La mayoría de las implementaciones de producción utilizan DDIM con 510 pasos, o una variante destilada de consistencia, para obtener control en tiempo real.

Cuando la política de difusión brilla

  • Las demostraciones contienen múltiples estrategias válidas (tipos de agarre, direcciones de aproximación, variaciones de entrega).
  • Manipulación rica en contacto en la que se componen pequeñas perturbaciones de acción ver [guía de manipulación rica en contacto]T8).
  • Te importa la robustez a las perturbaciones y tienes presupuesto para desestimar la inferencia iterativa.
  • Quieres que la política se expanda con más datos en lugar de plateauing.

El simple transformador que robó la corona bimanual

ACT fue introducido junto con el hardware bimanual Mobile ALOHA y ALOHA como la pila de aprendizaje de imitación de referencia. La arquitectura es deliberadamente simple: un ResNet codifica cada vista de la cámara, un codificador transformador las fusiona con la propriocepción, y un decodificador transformador emite una pieza de 50100 acciones futuras condicionadas a una CVAE latente aprendida. En el momento de la inferencia, ejecuta la pieza con ensamblaje temporal (previsión de superposición promedio), lo que suaviza la salida y reduce el error de composición.

La magia de ACT es la longitud de las piezas y el ensamblaje. Al predecir acciones en el futuro lejano, evita el clásico problema del "error de composición" del aprendizaje de imitación paso a paso. El resultado: en las tareas de teleop bimanual (estaclamiento de copas, vendaje de velcro, inserción de baterías), ACT tiene éxito regularmente con 50 demostraciones, mientras que una línea de base de clonación de comportamiento estándar necesitaría miles. ACT es la política de inicio para plataformas ALOHA) T9, y el marco LeRobot envía una implementación canónica de ACT.

Cuando ACT brilla

  • Datos de teleoperación bimanual ACT fue diseñado para esto y se muestra.
  • Necesitas entrenar rápido e iterar en el diseño de tareas en lugar de esperar a que la difusión converja.
  • El control de la frecuencia es importante y no quieres que la denotación iterativa en tu bucle.
  • Las demostraciones son relativamente consistentes (una única estrategia preferida).

Requisitos de datos

Ambas arquitecturas son eficientes en datos según los estándares modernos de VLA se está entrenando desde cero en una tarea estrecha, no en el ajuste fino de un modelo 7B. En la práctica, 50 demostraciones obtendrán ACT a una tasa de éxito razonable en una tarea de manipulación bimanual, y la Política de difusión normalmente necesita 100200 demostraciones para coincidir con ACT en tareas multimodal (y luego excederlo como escala de demostraciones). Si aún no ha recogido datos, [los servicios de teleoperatoria del RCSV]T10) capturan las grabaciones bimanual de 2050 Hz que ambas arquitecturas esperan, y nuestra [página del conjunto de datos de ALOHA]T11) tiene corpos de inicio listos.

Inferencia y despliegue

El paso único hacia adelante de ACT lo hace el objetivo de implementación más fácil. La ejecución de fragmentos con ensamblaje temporal se ejecuta cómodamente a 3050 Hz en una GPU portátil. La denociación iterativa de la Política de difusión es el caso más difícil pero la comunidad ha convergido en DDIM con 510 pasos o variantes destiladas de consistencia, lo que la lleva a frecuencias competitivas. Si está utilizando un dispositivo de borde, inclina hacia ACT; si está ejecutando en una estación de trabajo con un 4090 o mejor, está bien.

Compromiso honesto

La elegancia de ACT es también su límite. En tareas con demostraciones genuinamente multimodal, el CVAE de ACT puede desmoronarse en modo a la estrategia promedio, produciendo un comportamiento tímido o indeciso. Una heurística útil: si sus demostraciones son consistentes, comience con ACT; si sus demostraciones son diversas, comience con la Política de difusión. Siempre puede volver a entrenar con el otro si el primer pase decepciona.

Ambos algoritmos también son "solo" aprendizaje de imitación no se generalizan a través de las realizaciones de la manera que lo hace una base VLA. Si necesita transferencia de robots cruzados, empareje uno de estos con [OpenVLA]T12) o [Octo]T13) y use ACT/Difusion Policy como la cabeza de acción específica de la realización.

Indicadores de referencia a consultar

Ambas arquitecturas aparecen en [LIBERO]T14) y en las suites Push-T / Robomimic.

Detalles de ejecución que realmente importan

Ambos algoritmos son más simples de lo que sugieren la mayoría de los documentos de VLA, pero los detalles que determinan el éxito o el fracaso a menudo se pierden en el abstracto. Para Diffusion Policy, los tres trampas más comunes son: (1) el entrenamiento insuficiente del denoizador equipos se detienen en 50K pasos cuando se necesita rutinariamente 200K, (2) el mal ajuste de la normalización de la acción, especialmente cuando las acciones incluyen tanto la posición y los bits de agarre, y (3) no utilizar pesos EMA en la inferencia.

Para ACT, los botones críticos son la longitud de piezas y el ganancia temporal de ensamblaje. Los trozos cortos (menos de 20 pasos) hacen que ACT se comporte como clonación de comportamiento de vainilla y reintroduca el error de composición. Los trozos muy largos (más de 200) hacen que la política sea frágil a las perturbaciones. El ALOHA por defecto de 100 pasos con ensamblaje ponderado exponencialmente es un punto de partida fuerte sintonizar hacia abajo sólo si se ve un nervioso o hacia arriba sólo si se ve una deriva de horizonte largo.

Combinando las dos con una base VLA

En 2026, un número creciente de estacas de producción no eligen only ACT o only Diffusion Policy utilizan uno como la cabeza de acción de bajo nivel detrás de una VLA de fundación. El patrón: una VLA como [OpenVLA]T16) analiza la instrucción de lengua natural en un subobjetivo consciente de la escena, y un jefe de ACT o de la Política de Diffusión ejecuta el movimiento de granos finos. Así se estructuraron la mayoría de las presentaciones de mejor rendimiento de CALVIN y LIBERO en 2025, y refleja una división de trabajo madura en el campo: modelos de base para el lenguaje y la abstracción, políticas de aprendizaje por imitación para la ejecución hábil.

Costo y esfuerzo de ingeniería

Ningún algoritmo es caro según los estándares modernos. Una única GPU de 24 GB (RTX 4090 o A6000) entrenará ACT o la Política de difusión en un conjunto de datos de 50 demostraciones en menos de un día. ACT generalmente converge más rápido en términos de reloj de pared porque cada paso es un único transformador hacia adelante y hacia atrás; la pérdida de múltiples pasos de la Política de difusión es más pesada pero converge en menos épocas. Se espera 412 horas de tiempo total de formación para una política decente en una tarea estrecha con la advertencia de que la recopilación y la curaduría de datos tardan mucho más que la formación misma.

Nuestra recomendación

Para las tareas bimanual de teleop especialmente en el hardware de estilo [ALOHA]T17) o [G1]T18) comienza con ACT. Se ejecutará en una tarde y la línea de base es difícil de superar con 50 demostraciones. Para la manipulación de un solo brazo con diversas demostraciones o tareas ricas en contactos, comience con ** Política de difusión**. Cuando hay dudas, entrenar ambos son lo suficientemente baratos como para correr en paralelo, y ver que ambos tienen éxito o ambos fracasan le dice algo importante sobre su conjunto de datos.

Lectura relacionada OpenVLA vs Octo → RT-X vs OpenVLA → Mejores modelos de VLA 2026 → Página modelo de política de difusión → Datos de ALOHA → Recolección de datos de Teleóp →

Cada VLA aquí puede ser ajustado a sus propias demostraciones.

Recoge demos → Hardware que lo ejecuta → Corre una política →