Volver a Blog

Política de difusión para el aprendizaje de robots: qué es y cómo usarlo

¿Qué es la política de difusión para los robots? Aprenda cómo los modelos de difusión superan a la clonación conductual, qué datos necesita, cómo entrenar y cómo los servicios de datos de RCSV apoyan los proyectos de política de difusión.

Parte de: [Guía de aprendizaje por imitación]

La Política de difusión, introducida por Chi et al. en 2023, trajo la revolución de la modelado generativo al control de robots. Al tratar la generación de acción como un problema denuciante, trata la naturaleza multimodal y de alta dimensión del comportamiento de manipulación de manera que los algoritmos de clonación de comportamiento más simples no pueden. Aquí está lo que necesita saber para aplicarlo a su propio proyecto de robótica.

¿Qué es la política de difusión?

La política de difusión es una clase de políticas de control de robots basadas en desinfectar modelos probabilísticos de difusión (DDPMs) el mismo marco matemático que subyace en modelos de texto a imagen como la difusión estable. Comenzando con el ruido gaussiano puro en el espacio de acción, el modelo lo denota iterablemente condicionado a la observación visual actual y al estado del robot, produciendo una secuencia de acción coherente y de alta calidad después de 10100 pasos denotables.

La idea clave es que los modelos de difusión aprenden una distribución de probabilidades completa sobre las acciones en lugar de predecir una sola mejor acción. Para la robótica, esto es crítico. Un modelo que debe desplomarse esta distribución a una sola predicción o se compromete a un modo y falla la otra mitad del tiempo, o promedia los modos y produce una extraña trayectoria intermediaria que falla siempre.

Teoría de la coincidencia de puntuaciones: cómo los modelos de difusión aprenden las acciones

La base matemática de la política de difusión es la coincidencia de puntajes el aprendizaje del gradiente de la densidad de probabilidad de registro de la distribución de datos. En el proceso avanzado, el ruido de Gaussian se agrega progresivamente a las trayectorias de acción del conjunto de datos de demostración sobre T, siguiendo un cronograma de variación. La red neuronal está entrenada para revertir este proceso: dada una trayectoria de acción ruidosa y la observación actual, predecir el ruido que se agregó (o equivalentemente, el "punto" el gradiente de la densidad del registro).

El objetivo de la formación es engañosamente simple: una pérdida media de error cuadrado entre el ruido previsto y el ruido real añadido durante el proceso avanzado.

L = E[Negando en el epsilon - epsilon_theta\sqrt\alpha_t) * a_0 + sqrt\1-alpha_t) * epsilon, o, t) t)

donde a_0 es la trayectoria de acción limpia, se muestra el ruido gaussiano, alfa_t es el parámetro del horario de ruido en el paso de tiempo t, y la expectativa es sobre todos los ejemplos de entrenamiento, muestras de ruido y pasos de tiempo.

Lo que hace que este trabajo para la robótica sea el mecanismo de condicionamiento. La observación o típicamente características de la imagen de un codificador de CNN o ViT, más estado proprioceptivo sesga la denotación hacia trayectorias de acción que son apropiadas para la escena actual. La misma red de denotación puede producir trayectorias radicalmente diferentes para diferentes observaciones, porque las características de observación dirigen el proceso de denotación a través de diferentes regiones de la distribución de acción aprendida.

U-Net vs arquitecturas de transformadores

El documento original de Política de Difusión (Chi et al., 2023) evaluó dos arquitecturas de la columna vertebral para la red de denotación.

CNN U-Net Backbone (Política de difusión-C)

La columna vertebral de U-Net trata la secuencia de acción como una señal 1D y aplica una arquitectura convolucionaria con conexiones saltadas la misma estructura utilizada en los modelos de difusión de imágenes, pero que opera en dimensiones temporales en lugar de espaciales.

  • Parámetros: ~25M para una configuración estándar
  • Tiempo de entrenamiento: 4-8 horas en RTX 3090 durante 200 episodios
  • Inferencia (DDPM, 100 pasos): ~900 ms por pieza de acción
  • Inferencia (DDIM, 10 pasos): ~15 ms por pieza de acción
  • Ventajas: Inferencia rápida, menor memoria de GPU, adecuada para políticas de tarea única
  • Debilidades: Capacidad limitada para configuraciones multitarea o con condiciones lingüísticas

La espalda del transformador (Política de difusión-T)

La columna vertebral del transformador trata cada paso de tiempo de acción como un token, añadiendo fichas de observación y incrustaciones de paso de tiempo de difusión a la secuencia.

  • Parámetros: ~60-100M dependiendo de la configuración
  • Tiempo de entrenamiento: 8-16 horas en RTX 3090 durante 200 episodios
  • Inferencia (DDPM, 100 pasos): ~2,5 segundos por pieza de acción
  • Inferencia (DDIM, 10 pasos): ~45 ms por pieza de acción
  • Ventajas: Capacidad más alta, mejor escalado de múltiples tareas, condicionamiento del lenguaje natural mediante la atención cruzada
  • Debilidades: Inferencia más lenta, mayor memoria de GPU (necesita 16 GB+ de VRAM), más difícil de sintonizar

** Recomendación práctica:** Utilice la columna vertebral de U-Net para políticas de tarea única donde la velocidad de inferencia es importante (control en tiempo real en 10Hz+). Utilice la columna vertebral de Transformer para políticas de tareas múltiples, configuraciones de idioma condicionadas o cuando tenga más de 500 demostraciones y la capacidad de beneficiarse de un modelo más grande.

Tiempo de injerencia: DDPM vs DDIM vs Destilación de consistencia

El costo de tiempo de inferencia de la política de difusión es su principal limitación práctica. El proceso de denotación requiere múltiples pasos hacia adelante a través de la red, cada uno produciendo una trayectoria de acción ligeramente menos ruidosa.

Scheduler Steps Latencia (U-Net, RTX 3090) Quality vs DDPM-100 Notes
DDPM 100 ~900ms Baseline (100%) Too slow for most real-time control
DDIM 25 ~40ms 98-99% Good default for deployment
DDIM 10 ~15ms 95-98% Recommended for 10Hz+ control
Consistency Distillation 1-3 ~3-5ms 90-95% Best for high-frequency control, requires additional training

El mecanismo de despejo de acción mitigará el problema de latencia: la política de difusión predice una cantidad de 16-32 acciones futuras en un solo pase denociante. Esta ejecución superpuesta significa que la tasa de control efectiva está limitada por el tiempo de ejecución de la pieza, no el tiempo de desinfección siempre y cuando la desinfección se complete antes de que se agote la pieza actual.

Por qué la política de difusión supera el clonamiento conductual estándar

La clonación conductual estándar (BC) entrena una política como un problema de regresión supervisada: dada la observación, predice la acción. Esto funciona cuando el mapeo de las observaciones a las acciones es determinista y unimodal. En la práctica, las tareas de manipulación rara vez lo son. Incluso tareas "simples" como elegir un bloque de una tabla implican múltiples ángulos de acercamiento válidos, poses de agarre y configuraciones pre-garre. Naive BC produce políticas que dudan en los puntos de decisión, hacen decisiones de movimiento comprometidas o fracasan directamente cuando la distribución de las pruebas difiere ligeramente de la capacitación.

La política de difusión supera constantemente las líneas de base de BC en las suites de manipulación de valores de referencia. En las evaluaciones de robots reales, la política de difusión demostró un comportamiento de recuperación más robusto cuando el robot alcanzó un estado intermedio ligeramente incorrecto, la política podría recuperarse porque se trataba de muestras de una amplia distribución en lugar de seguir un camino determinista.

Resultados de referencia: Robomimic y RoboSuite

Task (Robomimic) BC (MLP) BC-RNN ACT Diffusion Policy
Lift 78% 96% 98% 100%
Can 54% 82% 90% 96%
Square (bimanual) 18% 56% 72% 88%
Transport (long-horizon) 6% 24% 48% 62%

Los márgenes son más grandes en tareas multimodal (Cuarzo, Transporte) donde existen múltiples estrategias válidas. En tareas unimodal (Levante), la ventaja es menor porque todas las líneas de base pueden encontrar la única estrategia correcta.

Cuándo elegir política de difusión frente a ACT

En comparación con ACT (Action Chunking with Transformers), la política de difusión generalmente se desempeña mejor en tareas con una fuerte multimodalidad y peor en tareas con dependencias de horizonte largo donde brilla la predicción de piezas de ACT. Aquí hay un marco de decisión:

Choose Diffusion Policy When Choose ACT When
Multiple valid grasp strategies exist for each scene Task has a single dominant strategy
You have 300+ demonstrations and want to leverage data scale You have 50-150 demonstrations and need fast iteration
Recovery from perturbations is important Temporal consistency over long horizons matters more
Control rate of 10Hz is sufficient You need 50Hz+ control frequency
Single-arm manipulation with variable approach Bimanual coordination requiring tight temporal sync

En la práctica, ambos algoritmos son lo suficientemente competitivos como para que la calidad y la cantidad de los conjuntos de datos sean más importantes que la elección de la arquitectura de la política. Si no está seguro de cuál usar, pruebe ACT primero para la velocidad de iteración, luego la Política de difusión si observa fallos de media de modo.

Requisitos de datos para la política de difusión

La política de difusión se beneficia de más datos que ACT, principalmente porque la red de denotación tiene más parámetros y un objetivo de modelado más rico. Para lograr un rendimiento robusto de implementación manejo de variaciones de posición de objetos, cambios de iluminación y ruido ocasional de sensores presupuesto de 300-500 demostraciones por tarea. A diferencia de ACT, la Política de difusión tiende a seguir mejorando con datos adicionales hasta tamaños de conjuntos de datos bastante grandes, por lo que es la mejor opción si planea invertir en un esfuerzo de recopilación de datos a gran escala.

La diversidad de datos es tan importante como el volumen. Las demostraciones deben abarcar el rango de posiciones de objetos, orientaciones y configuraciones de escena que se espera en el despliegue. Un grupo estrecho de demostraciones con objetos siempre en el mismo lugar producirá una política que falla en el momento en que un objeto se mueve unos pocos centímetros. El [servicio de recogida de datos administrado] de RCSV T1) sigue protocolos de variación estructurados aleatorización sistemática de posiciones de objetos, condiciones de iluminación y estilos de agarre del operador para garantizar conjuntos de datos que producen políticas generalizables.

La representación de observación también es importante. La política de difusión con un codificador de imágenes de ResNet entrenado de extremo a extremo generalmente supera las políticas que utilizan codificadores pre-entrenados congelados en distribuciones de tareas estrechas, pero los codificadores pre-entrenados (R3M, MVP, DINO) producen una mejor generalización cuando las condiciones de prueba difieren de la capacitación. Para la mayoría de los proyectos prácticos, comience con un codificador pre-entrenado para maximizar el valor de su conjunto de datos, y cambie a la capacitación de extremo a extremo solo si tiene más de 500 demostraciones y un entorno estable.

Configuración de la formación y requisitos de computación

La implementación de referencia de la Política de Difusión (disponible en el Columbia Robotics Lab GitHub) se realiza con una columna vertebral de UNet (inflación más rápida, menor capacidad) o una columna vertebral de Transformer (inflación más lenta, mayor capacidad). El entrenamiento en un solo RTX 3090 o 4090 dura de 4 a 12 horas para un conjunto de datos de 200 episodios, dependiendo de la resolución de la observación y la longitud del horizonte de acción.

Los principales hiperparámetros para establecer correctamente: el horizonte de acción (cuántos pasos futuros predecir típicamente 16-32 para tareas de mesa), el número de pasos de difusión (100 para DDPM, 10-25 para DDIM con pérdida de calidad mínima), y la ventana de observación (cuántos cuadros pasados incluir típicamente 2). No cambie los tres a la vez; fije los otros al ajustar uno. El cambio más impactante para mejorar el rendimiento de las políticas es generalmente aumentar el tamaño del conjunto de datos, no ajustar los hiperparámetros de la arquitectura.

Comando de entrenamiento rápido

# Clone la implementación de referencia git clone T15 cd difusión_policy pip instalar -e . # Train U-Net variante en su conjunto de datos (formato ZARR) python train.py --config-dir=. --config-name=image_pusht_diffusion_policy_cnn \ task.dataset_path=/path/to/your/dataset.zarr \ training.num_epochs=3000 \ policy.noise_scheduler.num_train_timesteps=\100_steps.horizon=16 \ policy.n_obs_steps=2 # Evaluar con la inferencia de DDIM.py_confalu=. --conf name-image=\no_fig_policy\no_diffusion\\p_policy.\sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn

Para inferir en un robot real, el DDPM a 100 pasos es típicamente demasiado lento para el control de alta frecuencia. Utilice el programador DDIM con 10-25 pasos, que se ejecuta a ~20Hz en un RTX 3090 adecuado para el control de 10Hz con un amortiguador.

Utilización de los servicios de datos de RCSV para la política de difusión

RCSV [data services pipeline]T2) produce conjuntos de datos formateados para uso directo con la implementación de referencia de la Política de difusión y el marco HuggingFace LeRobot. El filtrado de calidad elimina los episodios en los que la tarea no se completó con éxito, el robot chocó con el entorno o la vacilación del operador produjo trayectorias no representativas.

Nuestro servicio de recogida utiliza la plataforma de teleoperatoria RCSV (RCSV teleoperación) con control de seguidores de líder con doble brazo, cámaras montadas en la muñeca y en la cabeza, y registro opcional de torque de fuerza. Para la capacitación de políticas de difusión de múltiples tareas donde una sola política aprende múltiples tareas condicionadas a la identificación de tareas o idioma podemos recopilar varias variantes de tareas dentro de la misma campaña y entregar un conjunto de datos unificado. Los programas piloto comienzan en $2,500 para 200 demostraciones; las campañas completas para más de 500 demostraciones comienzan en $8,000.

Los equipos que trabajan con las plataformas de hardware [OpenArm 1] (T4) ($4,500) o [ALOHA] (T5) obtienen soporte de hardware nativo; la integración de hardware personalizada está disponible bajo petición. Para los equipos que deseen evaluar la Política de difusión antes de invertir en la recopilación de datos, nuestros [conjuntos de datos públicos] T6) incluyen varios setos de datos de manipulación de cientos de episodios en formato ZARR listos para la capacitación. [Contacta con nuestro equipo] T7) para discutir sus requisitos de datos y cronograma.

Lectura relacionada