Acción de Chunking vs. Imitación de toda la trayectoria: una comparación práctica
Cuando utilizar el activo de la carga (ACT) vs. la clonación de comportamiento de trayectoria completa.
[← Investigación]
Comprender cuándo predecir los trozos de acción frente a trayectorias enteras y cómo la elección afecta el rendimiento del robot, el costo de la capacitación y la latencia de implementación.
El problema de la clonación de comportamientos ingenuos
La clonación de comportamiento estándar (BC) entrena a una política π a d e s para predecir la próxima acción dada la observación actual. Esto funciona bien para tareas cortas y de baja variabilidad, pero se descompone de dos maneras críticas a medida que aumenta la complejidad de la tarea.
Primero, erroros de composición: pequeños errores de predicción desplazan al robot a estados ligeramente desconocidos, lo que causa errores más grandes, que desplazan el estado más lejos
En segundo lugar, modus averaging: cuando existen múltiples estrategias válidas para la misma tarea (por ejemplo, agarrar un objeto desde la izquierda o la derecha), una política unimodal BC promedia las demostraciones, produciendo una trayectoria intermedio que no ejecuta ninguna estrategia con éxito.
¿Qué es el "Chunking de Acción"?
El proceso de acción, introducido en el documento ACT (Zhao et al., 2023), aborda los errores de composición prediciendo una secuencia de acciones futuras de H a partir de la observación actual, luego ejecutando las primeras acciones k antes de consultar de nuevo la política.
La política π(a_{t:t+H} ➡ s_t) produce una gran cantidad de acciones H a la vez. Con H=100 a 50 Hz control, una sola consulta cubre 2 segundos de movimiento. La clave: al predecir un plan de horizonte corto en lugar de un solo paso, la política aprovecha el contexto temporal para comprometerse con una estrategia coherente, evitando el problema de mediación.
- ** Tamaño de pieza H:** El número de pasos temporales futuros previstos en una sola consulta. Para la manipulación de mesa a 50 Hz, H=100 (2 segundos) es la configuración estándar de ACT.
- ** Frecuencia de re-planamiento k:** El número de acciones ejecutadas antes de consultar de nuevo la política. en ACT, k=H/4 a H (execución de piezas completas sin re-planamiento).
- CVAE encoder: ACT utiliza un Codificador Automático de variación condicional para codificar el estilo/modo de toda la demostración, lo que permite a la política comprometerse con una estrategia en lugar de promediar. Este es el mecanismo principal para manejar demostraciones multimodales.
Política de difusión: desmontaje mediante desmontaje
La política de difusión (Chi et al., 2023) logra un manejo similar de la multi-modalidad a través de un mecanismo diferente: modelar la distribución de la acción como un proceso de difusión en un trozo de acciones.
- Difusión de U-Net: Una U-Net convolucional denota trozos de acción. Inferencia más rápida (~10
50 ms en GPU) que la difusión basada en transformador. - Difusión de transformador: Mejor para capturar dependencias de largo alcance en secuencias de acción.
- Típico tamaño de la pieza: H=8
16 para las políticas de control de 10 Hz; H=32 64 para las políticas de 50 Hz. La política de difusión replantea cada pieza por defecto.
Análisis del horizonte de tareas
El tamaño adecuado de la pieza y la frecuencia de re-planamiento dependen en gran medida del horizonte de la tarea:
- Tascas de horizonte corto (<3 segundos): Simple pick-and-place, apilamiento de tazas. BC a menudo funciona adecuadamente. Si se utiliza ACT, H=50
100 a 50 Hz cubre toda la tarea en una o dos consultas. - Tascas de horizonte medio (3
15 segundos): Insertar peg, enrutamiento de cables, montaje de alimentos. Este es el punto de interés de ACT. H=100 cubre 2 segundos; replanar cada 2550 pasos (0.5 1 segundo) mantiene la política reactiva. - Tascas de largo horizonte (> 30 segundos): Flujos de trabajo completos de cocina, montaje de varios cajones, organización de salas. VLMs como RT-2 o OpenVLA manejan la descomposición de tareas de alto nivel; ACT o difusión manejan la ejecución de bajo nivel.
Requisitos de datos de formación
El fragmento cambia sus requisitos de datos de maneras sutiles:
- Requisito de coherencia temporal: El chunking de acción asume que los pasos temporales consecutivos en una demostración son parte de un plan coherente. Las dudas, correcciones y retrocesos dentro de una demostración confunden el predictor de la parte. Para las tareas ruidosas, el chunking de acción requiere aproximadamente 2 veces más datos que BC para lograr el mismo rendimiento, porque una mayor fracción de demos debe ser de alta calidad.
- Cobreza multi-modal: El CVAE en ACT requiere al menos 20
30 demostraciones de cada estrategia distinta para aprender un modo latente limpio. - ** Normalización de la longitud de los episodios:** Los episodios de longitud variable crean desafíos para la predicción de los pedazos fijos.
Indicadores de rendimiento
| Algorithm | ALOHA Insertion | ALOHA Transfer Cube | ALOHA Slot Battery | Inference Latencia |
|---|---|---|---|---|
| Clonación de Comportamiento | 45% | 62% | 30% | 2–5 ms |
| ACT (H=100) | 80% | 92% | 65% | 15–30 ms |
| Diffusion Policy (U-Net) | 76% | 88% | 60% | 10–50 ms |
| Diffusion Policy (Transformer) | 82% | 91% | 68% | 100–300 ms |
| ACT + temporal ensemble | 83% | 94% | 70% | 20–40 ms |
Los resultados anteriores del documento original de ACT (Zhao et al., 2023) y Chi et al. (2023) sobre el índice de referencia de manipulación bimanual ALOHA.
Para obtener recomendaciones sobre qué algoritmo se adapta a su tarea y situación de datos, consulte la plataforma de formación del RCSV [
Recomendaciones por tipo de tarea
| Task Type | Recommended Algorithm | Chunk Size | Notes |
|---|---|---|---|
| Simple pick-and-place | BC or ACT | N/A or H=50 | BC sufficient if single strategy |
| Precisión insertion | ACT or Diffusion-T | H=100 | Multi-modality in approach angle |
| Bimanual coordination | ACT | H=100–200 | Joint state space required |
| Long-horizon (>30s) | Hierarchical (VLM + ACT) | H=50–100 per subtask | Subtask decomposition required |
| Deformable objects | Diffusion Policy | H=32–64 | Diffusion handles uncertainty better |
| High-speed (>5 Hz query) | BC or U-Net Diffusion | H=8–16 | Transformer diffusion too slow |
Entrenar su política en la plataforma RCSV
La plataforma de entrenamiento RCSV admite BC, ACT, política de difusión y ajuste fino de OpenVLA con búsqueda automática de hiperparámetros. Conecte su conjunto de datos y lance una carrera de entrenamiento en minutos.







