Política de difusión para el aprendizaje de robots: qué es y cómo usarlo
¿Qué es la política de difusión para los robots? Aprenda cómo los modelos de difusión superan a la clonación conductual, qué datos necesita, cómo entrenar y cómo los servicios de datos de RCSV apoyan los proyectos de política de difusión.
Parte de: [Guía de aprendizaje por imitación]
La Política de difusión, introducida por Chi et al. en 2023, trajo la revolución de la modelado generativo al control de robots. Al tratar la generación de acción como un problema denuciante, trata la naturaleza multimodal y de alta dimensión del comportamiento de manipulación de manera que los algoritmos de clonación de comportamiento más simples no pueden. Aquí está lo que necesita saber para aplicarlo a su propio proyecto de robótica.
¿Qué es la política de difusión?
La política de difusión es una clase de políticas de control de robots basadas en desinfectar modelos probabilísticos de difusión (DDPMs)
La idea clave es que los modelos de difusión aprenden una distribución de probabilidades completa sobre las acciones en lugar de predecir una sola mejor acción. Para la robótica, esto es crítico. Un modelo que debe desplomarse esta distribución a una sola predicción o se compromete a un modo y falla la otra mitad del tiempo, o promedia los modos y produce una extraña trayectoria intermediaria que falla siempre.
Teoría de la coincidencia de puntuaciones: cómo los modelos de difusión aprenden las acciones
La base matemática de la política de difusión es la coincidencia de puntajes
El objetivo de la formación es engañosamente simple: una pérdida media de error cuadrado entre el ruido previsto y el ruido real añadido durante el proceso avanzado.
L = E[Negando en el epsilon - epsilon_theta\sqrt\alpha_t) * a_0 + sqrt\1-alpha_t) * epsilon, o, t) t)
donde a_0 es la trayectoria de acción limpia, se muestra el ruido gaussiano, alfa_t es el parámetro del horario de ruido en el paso de tiempo t, y la expectativa es sobre todos los ejemplos de entrenamiento, muestras de ruido y pasos de tiempo.
Lo que hace que este trabajo para la robótica sea el mecanismo de condicionamiento. La observación o
U-Net vs arquitecturas de transformadores
El documento original de Política de Difusión (Chi et al., 2023) evaluó dos arquitecturas de la columna vertebral para la red de denotación.
CNN U-Net Backbone (Política de difusión-C)
La columna vertebral de U-Net trata la secuencia de acción como una señal 1D y aplica una arquitectura convolucionaria con conexiones saltadas
- Parámetros: ~25M para una configuración estándar
- Tiempo de entrenamiento: 4-8 horas en RTX 3090 durante 200 episodios
- Inferencia (DDPM, 100 pasos): ~900 ms por pieza de acción
- Inferencia (DDIM, 10 pasos): ~15 ms por pieza de acción
- Ventajas: Inferencia rápida, menor memoria de GPU, adecuada para políticas de tarea única
- Debilidades: Capacidad limitada para configuraciones multitarea o con condiciones lingüísticas
La espalda del transformador (Política de difusión-T)
La columna vertebral del transformador trata cada paso de tiempo de acción como un token, añadiendo fichas de observación y incrustaciones de paso de tiempo de difusión a la secuencia.
- Parámetros: ~60-100M dependiendo de la configuración
- Tiempo de entrenamiento: 8-16 horas en RTX 3090 durante 200 episodios
- Inferencia (DDPM, 100 pasos): ~2,5 segundos por pieza de acción
- Inferencia (DDIM, 10 pasos): ~45 ms por pieza de acción
- Ventajas: Capacidad más alta, mejor escalado de múltiples tareas, condicionamiento del lenguaje natural mediante la atención cruzada
- Debilidades: Inferencia más lenta, mayor memoria de GPU (necesita 16 GB+ de VRAM), más difícil de sintonizar
** Recomendación práctica:** Utilice la columna vertebral de U-Net para políticas de tarea única donde la velocidad de inferencia es importante (control en tiempo real en 10Hz+). Utilice la columna vertebral de Transformer para políticas de tareas múltiples, configuraciones de idioma condicionadas o cuando tenga más de 500 demostraciones y la capacidad de beneficiarse de un modelo más grande.
Tiempo de injerencia: DDPM vs DDIM vs Destilación de consistencia
El costo de tiempo de inferencia de la política de difusión es su principal limitación práctica. El proceso de denotación requiere múltiples pasos hacia adelante a través de la red, cada uno produciendo una trayectoria de acción ligeramente menos ruidosa.
| Scheduler | Steps | Latencia (U-Net, RTX 3090) | Quality vs DDPM-100 | Notes |
|---|---|---|---|---|
| DDPM | 100 | ~900ms | Baseline (100%) | Too slow for most real-time control |
| DDIM | 25 | ~40ms | 98-99% | Good default for deployment |
| DDIM | 10 | ~15ms | 95-98% | Recommended for 10Hz+ control |
| Consistency Distillation | 1-3 | ~3-5ms | 90-95% | Best for high-frequency control, requires additional training |
El mecanismo de despejo de acción mitigará el problema de latencia: la política de difusión predice una cantidad de 16-32 acciones futuras en un solo pase denociante. Esta ejecución superpuesta significa que la tasa de control efectiva está limitada por el tiempo de ejecución de la pieza, no el tiempo de desinfección
Por qué la política de difusión supera el clonamiento conductual estándar
La clonación conductual estándar (BC) entrena una política como un problema de regresión supervisada: dada la observación, predice la acción. Esto funciona cuando el mapeo de las observaciones a las acciones es determinista y unimodal. En la práctica, las tareas de manipulación rara vez lo son. Incluso tareas "simples" como elegir un bloque de una tabla implican múltiples ángulos de acercamiento válidos, poses de agarre y configuraciones pre-garre. Naive BC produce políticas que dudan en los puntos de decisión, hacen decisiones de movimiento comprometidas o fracasan directamente cuando la distribución de las pruebas difiere ligeramente de la capacitación.
La política de difusión supera constantemente las líneas de base de BC en las suites de manipulación de valores de referencia. En las evaluaciones de robots reales, la política de difusión demostró un comportamiento de recuperación más robusto
Resultados de referencia: Robomimic y RoboSuite
| Task (Robomimic) | BC (MLP) | BC-RNN | ACT | Diffusion Policy |
|---|---|---|---|---|
| Lift | 78% | 96% | 98% | 100% |
| Can | 54% | 82% | 90% | 96% |
| Square (bimanual) | 18% | 56% | 72% | 88% |
| Transport (long-horizon) | 6% | 24% | 48% | 62% |
Los márgenes son más grandes en tareas multimodal (Cuarzo, Transporte) donde existen múltiples estrategias válidas. En tareas unimodal (Levante), la ventaja es menor porque todas las líneas de base pueden encontrar la única estrategia correcta.
Cuándo elegir política de difusión frente a ACT
En comparación con ACT (Action Chunking with Transformers), la política de difusión generalmente se desempeña mejor en tareas con una fuerte multimodalidad y peor en tareas con dependencias de horizonte largo donde brilla la predicción de piezas de ACT. Aquí hay un marco de decisión:
| Choose Diffusion Policy When | Choose ACT When |
|---|---|
| Multiple valid grasp strategies exist for each scene | Task has a single dominant strategy |
| You have 300+ demonstrations and want to leverage data scale | You have 50-150 demonstrations and need fast iteration |
| Recovery from perturbations is important | Temporal consistency over long horizons matters more |
| Control rate of 10Hz is sufficient | You need 50Hz+ control frequency |
| Single-arm manipulation with variable approach | Bimanual coordination requiring tight temporal sync |
En la práctica, ambos algoritmos son lo suficientemente competitivos como para que la calidad y la cantidad de los conjuntos de datos sean más importantes que la elección de la arquitectura de la política. Si no está seguro de cuál usar, pruebe ACT primero para la velocidad de iteración, luego la Política de difusión si observa fallos de media de modo.
Requisitos de datos para la política de difusión
La política de difusión se beneficia de más datos que ACT, principalmente porque la red de denotación tiene más parámetros y un objetivo de modelado más rico. Para lograr un rendimiento robusto de implementación
La diversidad de datos es tan importante como el volumen. Las demostraciones deben abarcar el rango de posiciones de objetos, orientaciones y configuraciones de escena que se espera en el despliegue. Un grupo estrecho de demostraciones con objetos siempre en el mismo lugar producirá una política que falla en el momento en que un objeto se mueve unos pocos centímetros. El [servicio de recogida de datos administrado] de RCSV
La representación de observación también es importante. La política de difusión con un codificador de imágenes de ResNet entrenado de extremo a extremo generalmente supera las políticas que utilizan codificadores pre-entrenados congelados en distribuciones de tareas estrechas, pero los codificadores pre-entrenados (R3M, MVP, DINO) producen una mejor generalización cuando las condiciones de prueba difieren de la capacitación. Para la mayoría de los proyectos prácticos, comience con un codificador pre-entrenado para maximizar el valor de su conjunto de datos, y cambie a la capacitación de extremo a extremo solo si tiene más de 500 demostraciones y un entorno estable.
Configuración de la formación y requisitos de computación
La implementación de referencia de la Política de Difusión (disponible en el Columbia Robotics Lab GitHub) se realiza con una columna vertebral de UNet (inflación más rápida, menor capacidad) o una columna vertebral de Transformer (inflación más lenta, mayor capacidad). El entrenamiento en un solo RTX 3090 o 4090 dura de 4 a 12 horas para un conjunto de datos de 200 episodios, dependiendo de la resolución de la observación y la longitud del horizonte de acción.
Los principales hiperparámetros para establecer correctamente: el horizonte de acción (cuántos pasos futuros predecir
Comando de entrenamiento rápido
# Clone la implementación de referencia git clone
Para inferir en un robot real, el DDPM a 100 pasos es típicamente demasiado lento para el control de alta frecuencia. Utilice el programador DDIM con 10-25 pasos, que se ejecuta a ~20Hz en un RTX 3090
Utilización de los servicios de datos de RCSV para la política de difusión
RCSV [data services pipeline]
Nuestro servicio de recogida utiliza la plataforma de teleoperatoria RCSV (RCSV teleoperación) con control de seguidores de líder con doble brazo, cámaras montadas en la muñeca y en la cabeza, y registro opcional de torque de fuerza. Para la capacitación de políticas de difusión de múltiples tareas
Los equipos que trabajan con las plataformas de hardware [OpenArm 1] (T4
Lectura relacionada
- Modelos de VLA explicados -- Cuándo utilizar VLAs en lugar de Política de difusión
- Guía de robots de ALOHA -- ACT vs Política de difusión en el hardware de ALOHA
- [¿Qué es los datos de formación de robots?]
- Annotación de datos de robots -- Etiquetado de conjuntos de datos de políticas de difusión
- Servicios de datos de la RCSV -- Datos de formato ZARR para la política de difusión
- Conjuntos de datos públicos -- Conjuntos de datos de manipulación listos para el entrenamiento
- [Benzmarks]
T14 ) -- Comparar el desempeño de las políticas entre las tareas







