Volver a Research

Acción de Chunking vs. Imitación de toda la trayectoria: una comparación práctica

Cuando utilizar el activo de la carga (ACT) vs. la clonación de comportamiento de trayectoria completa.

[← Investigación]

Comprender cuándo predecir los trozos de acción frente a trayectorias enteras y cómo la elección afecta el rendimiento del robot, el costo de la capacitación y la latencia de implementación.

El problema de la clonación de comportamientos ingenuos

La clonación de comportamiento estándar (BC) entrena a una política π a d e s para predecir la próxima acción dada la observación actual. Esto funciona bien para tareas cortas y de baja variabilidad, pero se descompone de dos maneras críticas a medida que aumenta la complejidad de la tarea.

Primero, erroros de composición: pequeños errores de predicción desplazan al robot a estados ligeramente desconocidos, lo que causa errores más grandes, que desplazan el estado más lejos llevando a un fracaso catastrófico mucho antes de que la tarea esté completa. Este es el clásico problema de DAgger. En la práctica, las políticas de BC para tareas de mesa a menudo tienen éxito en un 80% durante las implementaciones de capacitación (que permanecen en distribución) pero no logran alcanzar el 4050% en la implementación de la misma tarea.

En segundo lugar, modus averaging: cuando existen múltiples estrategias válidas para la misma tarea (por ejemplo, agarrar un objeto desde la izquierda o la derecha), una política unimodal BC promedia las demostraciones, produciendo una trayectoria intermedio que no ejecuta ninguna estrategia con éxito.

¿Qué es el "Chunking de Acción"?

El proceso de acción, introducido en el documento ACT (Zhao et al., 2023), aborda los errores de composición prediciendo una secuencia de acciones futuras de H a partir de la observación actual, luego ejecutando las primeras acciones k antes de consultar de nuevo la política.

La política π(a_{t:t+H} ➡ s_t) produce una gran cantidad de acciones H a la vez. Con H=100 a 50 Hz control, una sola consulta cubre 2 segundos de movimiento. La clave: al predecir un plan de horizonte corto en lugar de un solo paso, la política aprovecha el contexto temporal para comprometerse con una estrategia coherente, evitando el problema de mediación.

  • ** Tamaño de pieza H:** El número de pasos temporales futuros previstos en una sola consulta. Para la manipulación de mesa a 50 Hz, H=100 (2 segundos) es la configuración estándar de ACT.
  • ** Frecuencia de re-planamiento k:** El número de acciones ejecutadas antes de consultar de nuevo la política. en ACT, k=H/4 a H (execución de piezas completas sin re-planamiento).
  • CVAE encoder: ACT utiliza un Codificador Automático de variación condicional para codificar el estilo/modo de toda la demostración, lo que permite a la política comprometerse con una estrategia en lugar de promediar. Este es el mecanismo principal para manejar demostraciones multimodales.

Política de difusión: desmontaje mediante desmontaje

La política de difusión (Chi et al., 2023) logra un manejo similar de la multi-modalidad a través de un mecanismo diferente: modelar la distribución de la acción como un proceso de difusión en un trozo de acciones.

  • Difusión de U-Net: Una U-Net convolucional denota trozos de acción. Inferencia más rápida (~1050 ms en GPU) que la difusión basada en transformador.
  • Difusión de transformador: Mejor para capturar dependencias de largo alcance en secuencias de acción.
  • Típico tamaño de la pieza: H=816 para las políticas de control de 10 Hz; H=3264 para las políticas de 50 Hz. La política de difusión replantea cada pieza por defecto.

Análisis del horizonte de tareas

El tamaño adecuado de la pieza y la frecuencia de re-planamiento dependen en gran medida del horizonte de la tarea:

  • Tascas de horizonte corto (<3 segundos): Simple pick-and-place, apilamiento de tazas. BC a menudo funciona adecuadamente. Si se utiliza ACT, H=50100 a 50 Hz cubre toda la tarea en una o dos consultas.
  • Tascas de horizonte medio (315 segundos): Insertar peg, enrutamiento de cables, montaje de alimentos. Este es el punto de interés de ACT. H=100 cubre 2 segundos; replanar cada 2550 pasos (0.51 segundo) mantiene la política reactiva.
  • Tascas de largo horizonte (> 30 segundos): Flujos de trabajo completos de cocina, montaje de varios cajones, organización de salas. VLMs como RT-2 o OpenVLA manejan la descomposición de tareas de alto nivel; ACT o difusión manejan la ejecución de bajo nivel.

Requisitos de datos de formación

El fragmento cambia sus requisitos de datos de maneras sutiles:

  • Requisito de coherencia temporal: El chunking de acción asume que los pasos temporales consecutivos en una demostración son parte de un plan coherente. Las dudas, correcciones y retrocesos dentro de una demostración confunden el predictor de la parte. Para las tareas ruidosas, el chunking de acción requiere aproximadamente 2 veces más datos que BC para lograr el mismo rendimiento, porque una mayor fracción de demos debe ser de alta calidad.
  • Cobreza multi-modal: El CVAE en ACT requiere al menos 2030 demostraciones de cada estrategia distinta para aprender un modo latente limpio.
  • ** Normalización de la longitud de los episodios:** Los episodios de longitud variable crean desafíos para la predicción de los pedazos fijos.

Indicadores de rendimiento

Algorithm ALOHA Insertion ALOHA Transfer Cube ALOHA Slot Battery Inference Latencia
Clonación de Comportamiento 45% 62% 30% 2–5 ms
ACT (H=100) 80% 92% 65% 15–30 ms
Diffusion Policy (U-Net) 76% 88% 60% 10–50 ms
Diffusion Policy (Transformer) 82% 91% 68% 100–300 ms
ACT + temporal ensemble 83% 94% 70% 20–40 ms

Los resultados anteriores del documento original de ACT (Zhao et al., 2023) y Chi et al. (2023) sobre el índice de referencia de manipulación bimanual ALOHA.

Para obtener recomendaciones sobre qué algoritmo se adapta a su tarea y situación de datos, consulte la plataforma de formación del RCSV [T1] o la [encuesta de modelos de base] [T2].

Recomendaciones por tipo de tarea

Task Type Recommended Algorithm Chunk Size Notes
Simple pick-and-place BC or ACT N/A or H=50 BC sufficient if single strategy
Precisión insertion ACT or Diffusion-T H=100 Multi-modality in approach angle
Bimanual coordination ACT H=100–200 Joint state space required
Long-horizon (>30s) Hierarchical (VLM + ACT) H=50–100 per subtask Subtask decomposition required
Deformable objects Diffusion Policy H=32–64 Diffusion handles uncertainty better
High-speed (>5 Hz query) BC or U-Net Diffusion H=8–16 Transformer diffusion too slow

Entrenar su política en la plataforma RCSV

La plataforma de entrenamiento RCSV admite BC, ACT, política de difusión y ajuste fino de OpenVLA con búsqueda automática de hiperparámetros. Conecte su conjunto de datos y lance una carrera de entrenamiento en minutos.

Explora la plataforma →