Volver a Blog

Política de difusión para el aprendizaje robot: cómo funciona y cuándo usarlo (2026)

Política de difusión para la manipulación de robots: cómo la denunciación predice acciones, CNN vs transformador, y cuando supera ACT y clonación conductual. Guía 2026.

La política de difusión es el algoritmo de aprendizaje de imitación líder para las tareas de manipulación de robots ricas en contacto y hábiles. Superó consistentemente la clonación conductual estándar y a menudo supera a ACT en tareas con demostraciones multimodal. Esta guía explica cómo funciona, cómo se compara con ACT y BC, qué hiperparámetros son más importantes y qué hardware se debe emparejar con en RCSV.

¿Qué es la política de difusión?

La política de difusión, introducida por Chi et al. en la Universidad de Columbia en 2023, aplica el marco de coincidencia de puntuaciones desde modelos de difusión de generación de imágenes (DDPM, DDIM) a la predicción de acción robótica. En lugar de predecir una sola acción o una secuencia de acción corta a partir de una observación, la política aprende a denotar iterativamente una trayectoria de acción aleatoria en un plan de movimiento coherente y de alta calidad. El resultado es una política de acción que, en la práctica, es significativamente mejor para manejar la naturaleza multimodal de los datos de demostración humana que la clonación conductual clásica.

La idea principal es simple: cuando se recopilan demostraciones de robots de operadores humanos, diferentes operadores a menudo realizan la misma tarea de maneras cualitativamente diferentes. Un modelo de clonación conductual estándar entrenado con un error cuadrado medio promediará en estos modos y producirá una acción que está "entre" dos comportamientos válidos que normalmente es invalida en sí misma.

El documento demostró la política de difusión en 12 tareas de manipulación simuladas y de robots reales, logrando resultados de última generación en 11 de ellos.

Cómo funciona la política de difusión

La formación y la inferencia para la política de difusión siguen el marco estándar de denotación del DDPM, adaptado a secuencias de acción en lugar de imágenes.

Formación

Durante el entrenamiento, una trayectoria de acción limpia T0 (tomada en muestra del conjunto de datos de demostración) se corrompe progresivamente añadiendo el ruido gaussiano en los pasos de tiempo de T (típicamente T=100) de acuerdo con un calendario de ruido. La red neuronal ya sea una CNN temporal 1D o un transformador está entrenada para predecir el ruido que se agregó en cada paso, dada la acción ruidosa, el índice de paso denociante y la observación robótica actual (imagen + propriocepción). Este es el objetivo estándar de coincidencia de puntuación. La red aprende a mapear a partir de (acción ruidosa, paso de tiempo, observación) → ruido predicho, y el MSE entre ruido predicho y verdadero se minimiza en todos los pares de entrenamiento.

Inferencia

En el momento de la inferencia, el modelo comienza desde un vector de ruido puro de la misma dimensionalidad que una secuencia de acción. Luego ejecuta pasos denociantes de K_ (típicamente K=10 para DDIM, K=100 para DDPM) cada paso llamando a la red neuronal para predecir el componente de ruido y restándolo, guiado por la observación actual. Después de los pasos K, el resultado es una secuencia de acción completa (generalmente 1632 pasos adelante a 10Hz, o 50100 pasos a 50Hz) que representa una continuación plausible y suave del estado actual.

El condicionamiento de observación es la elección arquitectónica clave.

  • ** Basado en CNN (DP-C):** Una columna vertebral ResNet-18 o ResNet-34 codifica las observaciones de imágenes en un vector de características, que luego se fusiona con el estado proprioceptivo y se utiliza para condicionar la CNN denociante.
  • ** Transformador basado (DP-T):** Un transformador de estilo ViT codifica los tokens de imagen y los fusiona con los tokens de propriocepción.

Receso del control del horizonte

Una aplicación crítica: la política de difusión utiliza un enfoque de horizonte de retroceso. La política predice una secuencia de acción de longitud Tp (por ejemplo, 16 pasos), pero solo ejecuta los primeros pasos Ta (por ejemplo, 8 pasos) antes de la re-plantación. Esto crea un equilibrio entre la consistencia temporal (más larga Tp = movimientos más suaves) y la reactividad (Ta más corto = respuesta más rápida a cambios inesperados). La relación Tp/Ta = 2 es el estándar predeterminado y funciona bien para la mayoría de las tareas de manipulación.

Política de difusión frente a ACT: una comparación práctica

Property Diffusion Policy ACT (Action Chunking Transformers)
Multimodal action distributions Excellent — models full distribution Good — CVAE captures variance but can mode-average
Inference latency (RTX 3090) 40–120ms (DDIM K=10 to K=100) ~10ms (single forward pass)
Training time (50 demos, RTX 3090) 4–8 hours (CNN), 8–16 hours (Transformer) 2–4 hours
Temporal consistency High — denoising produces smooth trajectories High — action chunking provides consistency
Bimanual coordination Good with transformer variant Excellent — natively designed for ALOHA bimanual
Dexterous hand control (20+ DOF) Excellent — handles high-dim action spaces well Moderate — chunk size tuning needed for high DOF
Open-source reference implementation Yes — diffusion_policy repo (Columbia) Yes — act repo (Stanford)
LeRobot integration Yes — native support Yes — native support

La comparación principal: ACT es más rápido en la inferencia y más fácil de entrenar, lo que lo hace mejor para sistemas críticos en el tiempo y equipos con computación limitada. En la práctica, para la mayoría de las tareas de manipulación de mesa con 50200 demostraciones limpias, el rendimiento es comparable. Elige la política de difusión cuando sus demostraciones son naturalmente variadas o su espacio de acción excede 14 DOF. Consulte nuestra guía de política de ACT (T10) para una inmersión más profunda en el ajuste específico de ACT.

Política de difusión frente a clonación comportamental estándar

La clonación conductual estándar (BC) minimiza la MSE entre las acciones previstas y demostradas. Esto funciona cuando el conjunto de datos de demostración es unimodal cuando cada operador hace la tarea de la misma manera. El problema es que las demostraciones humanas casi nunca lo son. Cuando una política de BC ve una observación que apareció en demostraciones con dos acciones posteriores diferentes, las promedia, produciendo un movimiento que es incorrecto en ambos casos.

La política de difusión evita la mediación de modos porque modela toda la distribución condicional p acción observación) en lugar de sólo la media condicional E [acción observación ]. Dada la misma observación ambigua, una política de difusión muestra coherentemente de un modo u otro nunca mediando. Es por ello que el documento original mostró las mayores mejoras en comparación con BC en tareas que tenían la mayor variación de demostración: la tarea de empuje (los operadores empujaron el bloque desde diferentes ángulos) y la tarea de propagación bimanual (los operadores utilizaron diferentes estrategias de coordinación).

En la práctica, si su tarea tiene una variación inferior al 5% en las trayectorias demostradas (es decir, todos los operadores hacen exactamente lo mismo), BC con una buena columna vertebral puede coincidir con la política de difusión.

Cuándo elegir la política de difusión

Elige la política de difusión cuando:

  • Usted muestra multimodal. Si diferentes operadores completan la tarea mediante estrategias de movimiento significativamente diferentes, la política de difusión se encarga mejor de esto que ACT o BC.
  • Tienes un espacio de acción de alto DOF. Las manos dexterosas (1620+ DOF) se benefician más de la capacidad de la política de difusión para modelar correlaciones conjuntas en toda la dimensión de acción completa que el enfoque fijo basado en piezas de ACT.
  • Necesita un posicionamiento preciso de los puntos finales. El documento original mostró que la política de difusión logra una precisión de colocación inferior a 2 mm en tareas de inserción de precisión debido al refinamiento iterativo durante la desinfección.
  • Estás comparando los resultados publicados. Muchos artículos recientes (20242026) informan de la política de difusión como línea de base.
  • Tienes más presupuesto de GPU para entrenar. Si tienes múltiples GPUs, la capacitación de políticas de difusión se paralela bien y la variante transformadora logra mejores resultados con más computación.

Elige ACT Cuando:

  • La latencia de inferencia es crítica. A 10 ms por paso de inferencia, ACT puede ejecutarse a 100Hz en hardware modesto.
  • Estás trabajando con datos bimanual en formato ALOHA. ACT fue diseñado para ALOHA y la implementación de referencia no requiere conversión de formato.
  • El cálculo de la formación es limitado. Un entrenamiento ACT de 2 horas se ejecuta en comparación con 48 horas para cuestiones de política de difusión cuando se está iterando rápidamente en el diseño de tareas.
  • Estás coincidiendo con un resultado anterior específico. Si necesitas reproducir exactamente los números ACT de Stanford, usa ACT.

Hiperparámetros clave para la política de difusión

Estos son los parámetros que realmente mueven la aguja en la práctica, en orden de importancia aproximadamente descendente:

Parameter Default Effect of Increasing
pred_horizon (Tp) 16 Smoother trajectories; slower re-planning; more memory
action_horizon (Ta) 8 Fewer inference calls; less reactive to perturbations
obs_horizon 2 More temporal context; helps with tasks requiring memory of recent motion
num_diffusion_iters (K) 10 (DDIM), 100 (DDPM) Higher quality actions; slower inference
noise_scheduler DDIM DDPM is higher quality but 10x slower; DDIM preferred for real-time use
vision_encoder ResNet-18 ResNet-34 / ViT improves performance; requires more compute
n_obs_steps 2 Stacking more observation frames helps tasks with motion-based cues (sliding, rotating)

El error más común: establecer T8 demasiado largo y T9 demasiado corto. Esto produce políticas que se comprometen demasiado con una trayectoria planificada y no reaccionan a los eventos de contacto. Para la manipulación hábil, el punto de partida recomendado es Tp=16, Ta=8 y luego sintonizar desde allí en función de los modos de falla de tarea que observas.

# Instalar política de difusión (implementación de referencia de Columbia) git clone T24 cd difusión_policy conda env crear -f conda_environment.yaml conda activar robodiff # Train CNN variante en un conjunto de datos Push-T python train.py --config-name=train_diffusion_unet_lowdim_push_t_work space # Traen en su propio conjunto de datos (Le train.t_work space) python.py --config-name=train_diffusion\unet_hybrid_work space \ task.dataset\path=/to/your/lerobot_dataset._actionhorizon=16 \._horizon_task.\horizon_task.\\horizon_task.\\e2_size=6\e3_task.

Datos que funcionan bien con la política de difusión

La política de difusión tiene el mejor rendimiento en conjuntos de datos con estas características:

  • Tracetorias lisas y continuas: Debido a que el proceso de desinfección produce resultados suaves, las demostraciones con movimientos tirantes o discontinuos crean una desajuste entre el sesgo inductivo del modelo y los datos de entrenamiento.
  • Registro de estado de efecto final consistente: La política de difusión en la variante estándar de CNN utiliza la posición+orientación+gripper del efecto final como acción, no los ángulos conjuntos.
  • Múltiples vistas cuando estén disponibles: La variante transformadora (DP-T) puede utilizar 23 vistas de cámara como tokens.

Datas de referencia publicadas compatibles con la política de difusión

Dataset Tasks Notes
Push-T (Columbia) T-block pushing Reference benchmark; highly multimodal; download from diffusion_policy repo
RoboMimic Can, Lift, Square, Transport Standard benchmark; MH (multi-human) subset tests multimodal handling best
ALOHA / ACT datasets Bimanual tabletop tasks Requires joint-space conversion; diffusion policy-T performs comparably to ACT
DROID (Google) 76,000 diverse robot episodes Large-scale; good for fine-tuning pretrained diffusion models
RCSV custom datasets Varies by project Delivered in LeRobot format; compatible with diffusion_policy repo out of the box

Recomendaciones de hardware de la RCSV para la política de difusión

Tareales dexterosas: la mano Wuji

Para las tareas que requieren destreza de nivel de los dedos manipulación manual, ajuste de agarre, reorientación de objetos la [Mano de Wuji]T11) es la plataforma más fuerte para la política de difusión en RCSV. Con 20 DOF activos y 768 puntos de detección táctil por punta de los dedos, proporciona tanto un rico espacio de acción como un rico espacio de observación que la variante transformadora de la política de difusión puede explotar plenamente. En nuestros puntos de referencia internos, la política de difusión-T en Wuji Hand supera a ACT en tareas con interacciones de dedos ricas en contacto en 1825 puntos porcentuales en la tasa de éxito.

La matriz táctil de 768 puntos produce un vector de observación de 768 dimensiones por mano, que aplanamos y tokenizamos para el transformador DP-T. El tiempo de entrenamiento aumenta aproximadamente en un 40% en comparación con una política visual pura, pero la tasa de éxito en tareas sensibles al contacto como la inserción de pines, el enrutamiento de cables y la inspección de superficie mejora sustancialmente.

Manipulación de la mesa: Base de brazo abierto

Para las tareas estándar de pick-and-place, montaje y uso de herramientas, la [OpenArm Base]T12) es la plataforma más rentable para el trabajo de política de difusión. La variante de la política de difusión de CNN se transmite en 46 horas en un solo RTX 4090 utilizando conjuntos de datos OpenArm de 100 demostraciones.

Para configuraciones bimanual OpenArm (dos brazos en un marco de montaje compartido), se recomienda la variante transformadora la atención cruzada adicional a través de los vectores de estado conjunto de ambos brazos captura patrones de coordinación bimanual que la variante CNN pierde.

Requisitos de cálculo

Configuration Minimum Recommended
DP-C (CNN, single camera) RTX 3060 12GB, 32GB RAM RTX 3090 24GB, 64GB RAM
DP-T (Transformer, 3 cameras) RTX 4080 16GB, 64GB RAM RTX 4090 24GB or A100 40GB
DP-T + Wuji tactile (768D obs) RTX 4090 24GB, 128GB RAM A100 80GB or 2x RTX 4090

Los [servicios de datos] de RCSV incluyen acceso a nodos de capacitación A100 para ejecuciones de políticas de difusión que superan la capacidad de computación local.

Preguntas frecuentes

¿Qué es la política de difusión en robótica?

La política de difusión es un algoritmo de aprendizaje de imitación que trata la predicción de la acción como un proceso de difusión desmintiente. En el momento de la inferencia, se inicia a partir del ruido de Gaussian aleatorio y la perfecciona iterativamente en una secuencia de acción coherente condicionada a la observación robótica actual. Este enfoque puede representar distribuciones de acción multimodal múltiples formas válidas de completar una tarea con las que se enfrentan la clonación conductual estándar e incluso ACT. Fue introducido por Chi et al. en la Universidad de Columbia en 2023.

¿Cuándo debería usar la política de difusión en lugar de ACT?

La política de difusión es la mejor opción cuando su tarea tiene demostraciones multimodal (operadores que completan la misma tarea de maneras significativamente diferentes), cuando necesita un control preciso de los puntos finales o cuando sus demostraciones tienen una alta variación. ACT es más rápido en la inferencia y requiere menos computación para la capacitación, lo que lo hace mejor para aplicaciones con limitación de latencia y equipos con recursos limitados de GPU. Para la mayoría de las tareas de manipulación de mesa con 50200 demostraciones, ACT y la política de difusión funcionan de manera comparable.

¿Cuánto tiempo se tarda en entrenar la política de difusión?

La formación de la política de difusión basada en CNN en un conjunto de datos de mesa estándar (50200 episodios) toma 48 horas en un solo RTX 3090 o RTX 4090. La variante basada en transformador toma 816 horas para el mismo tamaño del conjunto de datos. El tiempo de entrenamiento se escala aproximadamente linealmente con el tamaño del conjunto de datos. La plataforma de RCSV proporciona tuberías de entrenamiento preconfiguradas que reducen el tiempo de configuración a menos de 30 minutos.

¿Qué hardware funciona mejor con la política de difusión?

La política de difusión fue inicialmente comparada con tareas que requieren trayectorias precisas y lisas: empujar, inserción y pick-and-place. Para tareas de nivel de dedos hábiles, la [Wuji Hand] (T15) (20 DOF, táctil de 768 puntos) junto con la política de difusión superan a ACT en tareas con manipulación rica en contacto. Para tareas de brazo de mesa, [OpenArm Base] (T16) es la plataforma más rentable. RCSV admite ambas configuraciones con líneas de recogida de datos y formación gestionadas.

Lectura relacionada

  • [Política del ACT explicada]T17) Acción de la transformación con sumergimiento profundo
  • [Guía de robots de ALOHA]T18) Plataforma bimanual para la política de ACT y difusión
  • [Guía roboquímica]T19) Datos de referencia compatibles con la política de difusión
  • [Mejores robots para el aprendizaje por imitación]T20) Comparación de plataformas
  • [Mano de Wuji en RCSV] T21) 20 DOF mano hábil para la política de difusión
  • [OpenArm Base]T22) Armo de mesa para la formación en política de difusión
  • Servicios de datos de la RCSV Gestión de la recopilación de datos + canales de formación