Política de difusión para el aprendizaje robot: cómo funciona y cuándo usarlo (2026)
Política de difusión para la manipulación de robots: cómo la denunciación predice acciones, CNN vs transformador, y cuando supera ACT y clonación conductual. Guía 2026.
La política de difusión es el algoritmo de aprendizaje de imitación líder para las tareas de manipulación de robots ricas en contacto y hábiles. Superó consistentemente la clonación conductual estándar
¿Qué es la política de difusión?
La política de difusión, introducida por Chi et al. en la Universidad de Columbia en 2023, aplica el marco de coincidencia de puntuaciones desde modelos de difusión de generación de imágenes (DDPM, DDIM) a la predicción de acción robótica. En lugar de predecir una sola acción o una secuencia de acción corta a partir de una observación, la política aprende a denotar iterativamente una trayectoria de acción aleatoria en un plan de movimiento coherente y de alta calidad. El resultado es una política de acción que, en la práctica, es significativamente mejor para manejar la naturaleza multimodal de los datos de demostración humana que la clonación conductual clásica.
La idea principal es simple: cuando se recopilan demostraciones de robots de operadores humanos, diferentes operadores a menudo realizan la misma tarea de maneras cualitativamente diferentes. Un modelo de clonación conductual estándar entrenado con un error cuadrado medio promediará en estos modos y producirá una acción que está "entre" dos comportamientos válidos
El documento demostró la política de difusión en 12 tareas de manipulación simuladas y de robots reales, logrando resultados de última generación en 11 de ellos.
Cómo funciona la política de difusión
La formación y la inferencia para la política de difusión siguen el marco estándar de denotación del DDPM, adaptado a secuencias de acción en lugar de imágenes.
Formación
Durante el entrenamiento, una trayectoria de acción limpia
Inferencia
En el momento de la inferencia, el modelo comienza desde un vector de ruido puro de la misma dimensionalidad que una secuencia de acción. Luego ejecuta pasos denociantes de K_ (típicamente K=10 para DDIM, K=100 para DDPM)
El condicionamiento de observación es la elección arquitectónica clave.
- ** Basado en CNN (DP-C):** Una columna vertebral ResNet-18 o ResNet-34 codifica las observaciones de imágenes en un vector de características, que luego se fusiona con el estado proprioceptivo y se utiliza para condicionar la CNN denociante.
- ** Transformador basado (DP-T):** Un transformador de estilo ViT codifica los tokens de imagen y los fusiona con los tokens de propriocepción.
Receso del control del horizonte
Una aplicación crítica: la política de difusión utiliza un enfoque de horizonte de retroceso. La política predice una secuencia de acción de longitud Tp (por ejemplo, 16 pasos), pero solo ejecuta los primeros pasos Ta (por ejemplo, 8 pasos) antes de la re-plantación. Esto crea un equilibrio entre la consistencia temporal (más larga Tp = movimientos más suaves) y la reactividad (Ta más corto = respuesta más rápida a cambios inesperados). La relación Tp/Ta = 2 es el estándar predeterminado y funciona bien para la mayoría de las tareas de manipulación.
Política de difusión frente a ACT: una comparación práctica
| Property | Diffusion Policy | ACT (Action Chunking Transformers) |
|---|---|---|
| Multimodal action distributions | Excellent — models full distribution | Good — CVAE captures variance but can mode-average |
| Inference latency (RTX 3090) | 40–120ms (DDIM K=10 to K=100) | ~10ms (single forward pass) |
| Training time (50 demos, RTX 3090) | 4–8 hours (CNN), 8–16 hours (Transformer) | 2–4 hours |
| Temporal consistency | High — denoising produces smooth trajectories | High — action chunking provides consistency |
| Bimanual coordination | Good with transformer variant | Excellent — natively designed for ALOHA bimanual |
| Dexterous hand control (20+ DOF) | Excellent — handles high-dim action spaces well | Moderate — chunk size tuning needed for high DOF |
| Open-source reference implementation | Yes — diffusion_policy repo (Columbia) | Yes — act repo (Stanford) |
| LeRobot integration | Yes — native support | Yes — native support |
La comparación principal: ACT es más rápido en la inferencia y más fácil de entrenar, lo que lo hace mejor para sistemas críticos en el tiempo y equipos con computación limitada. En la práctica, para la mayoría de las tareas de manipulación de mesa con 50
Política de difusión frente a clonación comportamental estándar
La clonación conductual estándar (BC) minimiza la MSE entre las acciones previstas y demostradas. Esto funciona cuando el conjunto de datos de demostración es unimodal
La política de difusión evita la mediación de modos porque modela toda la distribución condicional p
En la práctica, si su tarea tiene una variación inferior al 5% en las trayectorias demostradas (es decir, todos los operadores hacen exactamente lo mismo), BC con una buena columna vertebral puede coincidir con la política de difusión.
Cuándo elegir la política de difusión
Elige la política de difusión cuando:
- Usted muestra multimodal. Si diferentes operadores completan la tarea mediante estrategias de movimiento significativamente diferentes, la política de difusión se encarga mejor de esto que ACT o BC.
- Tienes un espacio de acción de alto DOF. Las manos dexterosas (16
20+ DOF) se benefician más de la capacidad de la política de difusión para modelar correlaciones conjuntas en toda la dimensión de acción completa que el enfoque fijo basado en piezas de ACT. - Necesita un posicionamiento preciso de los puntos finales. El documento original mostró que la política de difusión logra una precisión de colocación inferior a 2 mm en tareas de inserción de precisión debido al refinamiento iterativo durante la desinfección.
- Estás comparando los resultados publicados. Muchos artículos recientes (2024
2026) informan de la política de difusión como línea de base. - Tienes más presupuesto de GPU para entrenar. Si tienes múltiples GPUs, la capacitación de políticas de difusión se paralela bien y la variante transformadora logra mejores resultados con más computación.
Elige ACT Cuando:
- La latencia de inferencia es crítica. A 10 ms por paso de inferencia, ACT puede ejecutarse a 100Hz en hardware modesto.
- Estás trabajando con datos bimanual en formato ALOHA. ACT fue diseñado para ALOHA y la implementación de referencia no requiere conversión de formato.
- El cálculo de la formación es limitado. Un entrenamiento ACT de 2 horas se ejecuta en comparación con 4
8 horas para cuestiones de política de difusión cuando se está iterando rápidamente en el diseño de tareas. - Estás coincidiendo con un resultado anterior específico. Si necesitas reproducir exactamente los números ACT de Stanford, usa ACT.
Hiperparámetros clave para la política de difusión
Estos son los parámetros que realmente mueven la aguja en la práctica, en orden de importancia aproximadamente descendente:
| Parameter | Default | Effect of Increasing |
|---|---|---|
pred_horizon (Tp) |
16 | Smoother trajectories; slower re-planning; more memory |
action_horizon (Ta) |
8 | Fewer inference calls; less reactive to perturbations |
obs_horizon |
2 | More temporal context; helps with tasks requiring memory of recent motion |
num_diffusion_iters (K) |
10 (DDIM), 100 (DDPM) | Higher quality actions; slower inference |
noise_scheduler |
DDIM | DDPM is higher quality but 10x slower; DDIM preferred for real-time use |
vision_encoder |
ResNet-18 | ResNet-34 / ViT improves performance; requires more compute |
n_obs_steps |
2 | Stacking more observation frames helps tasks with motion-based cues (sliding, rotating) |
El error más común: establecer
# Instalar política de difusión (implementación de referencia de Columbia) git clone
Datos que funcionan bien con la política de difusión
La política de difusión tiene el mejor rendimiento en conjuntos de datos con estas características:
- Tracetorias lisas y continuas: Debido a que el proceso de desinfección produce resultados suaves, las demostraciones con movimientos tirantes o discontinuos crean una desajuste entre el sesgo inductivo del modelo y los datos de entrenamiento.
- Registro de estado de efecto final consistente: La política de difusión en la variante estándar de CNN utiliza la posición+orientación+gripper del efecto final como acción, no los ángulos conjuntos.
- Múltiples vistas cuando estén disponibles: La variante transformadora (DP-T) puede utilizar 2
3 vistas de cámara como tokens.
Datas de referencia publicadas compatibles con la política de difusión
| Dataset | Tasks | Notes |
|---|---|---|
| Push-T (Columbia) | T-block pushing | Reference benchmark; highly multimodal; download from diffusion_policy repo |
| RoboMimic | Can, Lift, Square, Transport | Standard benchmark; MH (multi-human) subset tests multimodal handling best |
| ALOHA / ACT datasets | Bimanual tabletop tasks | Requires joint-space conversion; diffusion policy-T performs comparably to ACT |
| DROID (Google) | 76,000 diverse robot episodes | Large-scale; good for fine-tuning pretrained diffusion models |
| RCSV custom datasets | Varies by project | Delivered in LeRobot format; compatible with diffusion_policy repo out of the box |
Recomendaciones de hardware de la RCSV para la política de difusión
Tareales dexterosas: la mano Wuji
Para las tareas que requieren destreza de nivel de los dedos
La matriz táctil de 768 puntos produce un vector de observación de 768 dimensiones por mano, que aplanamos y tokenizamos para el transformador DP-T. El tiempo de entrenamiento aumenta aproximadamente en un 40% en comparación con una política visual pura, pero la tasa de éxito en tareas sensibles al contacto como la inserción de pines, el enrutamiento de cables y la inspección de superficie mejora sustancialmente.
Manipulación de la mesa: Base de brazo abierto
Para las tareas estándar de pick-and-place, montaje y uso de herramientas, la [OpenArm Base]
Para configuraciones bimanual OpenArm (dos brazos en un marco de montaje compartido), se recomienda la variante transformadora
Requisitos de cálculo
| Configuration | Minimum | Recommended |
|---|---|---|
| DP-C (CNN, single camera) | RTX 3060 12GB, 32GB RAM | RTX 3090 24GB, 64GB RAM |
| DP-T (Transformer, 3 cameras) | RTX 4080 16GB, 64GB RAM | RTX 4090 24GB or A100 40GB |
| DP-T + Wuji tactile (768D obs) | RTX 4090 24GB, 128GB RAM | A100 80GB or 2x RTX 4090 |
Los [servicios de datos] de RCSV incluyen acceso a nodos de capacitación A100 para ejecuciones de políticas de difusión que superan la capacidad de computación local.
Preguntas frecuentes
¿Qué es la política de difusión en robótica?
La política de difusión es un algoritmo de aprendizaje de imitación que trata la predicción de la acción como un proceso de difusión desmintiente. En el momento de la inferencia, se inicia a partir del ruido de Gaussian aleatorio y la perfecciona iterativamente en una secuencia de acción coherente condicionada a la observación robótica actual. Este enfoque puede representar distribuciones de acción multimodal
¿Cuándo debería usar la política de difusión en lugar de ACT?
La política de difusión es la mejor opción cuando su tarea tiene demostraciones multimodal (operadores que completan la misma tarea de maneras significativamente diferentes), cuando necesita un control preciso de los puntos finales o cuando sus demostraciones tienen una alta variación. ACT es más rápido en la inferencia y requiere menos computación para la capacitación, lo que lo hace mejor para aplicaciones con limitación de latencia y equipos con recursos limitados de GPU. Para la mayoría de las tareas de manipulación de mesa con 50
¿Cuánto tiempo se tarda en entrenar la política de difusión?
La formación de la política de difusión basada en CNN en un conjunto de datos de mesa estándar (50
¿Qué hardware funciona mejor con la política de difusión?
La política de difusión fue inicialmente comparada con tareas que requieren trayectorias precisas y lisas: empujar, inserción y pick-and-place. Para tareas de nivel de dedos hábiles, la [Wuji Hand] (T15
Lectura relacionada
- [Política del ACT explicada]
T17 ) Acción de la transformación con sumergimiento profundo - [Guía de robots de ALOHA]
T18 ) Plataforma bimanual para la política de ACT y difusión - [Guía roboquímica]
T19 ) Datos de referencia compatibles con la política de difusión - [Mejores robots para el aprendizaje por imitación]
T20 ) Comparación de plataformas - [Mano de Wuji en RCSV]
T21 ) 20 DOF mano hábil para la política de difusión - [OpenArm Base]
T22 ) Armo de mesa para la formación en política de difusión - Servicios de datos de la RCSV
Gestión de la recopilación de datos + canales de formación







