Entrenar una política bimanual con ACT
Unidad 5 de la ruta de aprendizaje bimanual DK1. Cree una política ACT en su conjunto de datos bimanual. ¿Por qué ACT sobresale en bimanual, comando de entrenamiento, lectura de curvas de entrenamiento, hiperparámetros. ~ 4 horas.
Unidad 5 de 6 · Formación en política · ~4 horas
Lanzar el entrenamiento ACT en su conjunto de datos bimanual sincronizado, entender las curvas bimanual de entrenamiento, y saber cuándo tiene un punto de control que vale la pena desplegar en la Unidad 6.
Por qué ACT es excelente en tareas bimanual
ACT (Action Chunked Transformers) fue desarrollado originalmente específicamente para la investigación de manipulación bimanual. Su visión central
El mecanismo de acción de desmontaje proporciona a la política un horizonte de planificación. En lugar de comprometerse con un solo comando conjunto en cada paso de tiempo de 50 Hz, ACT planifica 100 pasos por delante y suaviza la ejecución. Para una tarea de entrega, esto significa que la política puede "ver" el acercamiento de ambos brazos hacia el punto de entrega como parte de una secuencia planificada, en lugar de reaccionar a cada marco de forma independiente. Empiricamente, esto reduce a la mitad la tasa de fallos de transferencia media en comparación con los enfoques no fragmentados en conjuntos de datos bimanual.
Una advertencia: ACT asume que las demostraciones en su conjunto de datos representan una estrategia consistente. Si diferentes demostraciones muestran formas fundamentalmente diferentes de ejecutar la entrega
Comando de entrenamiento
fuente ~/dk1-env/bin/activar python -m lerobot.scripts.train \ --policy-type act \ --dataset-repo-id cube-handoff-v1 \ --root ~/dk1-datasets \ --output-dir ~/dk1-policies/cube-handoff-v1 \ --config-overrides \ policy.action_dim=14 \ policy.chunk_size=100 \ policy.n\action_steps=100 \ policy.dim_feedforward=3200 \ policy.n\heads=8 \ policy.n\encoder=4 \ save.n_decoder=7 training.number\steps=80000\dimensional training.frequency training.\\quickness training.\quickness training.\quickness training.\quickness training.\quickness training.\quickness training.\quickness training.\quickness training.\quickness training.\quickness training.\quickness training.\\quickness training.\\quickness training.\\quickness training.\\\quickness training.\\\\\r\r\r\r\r\r\r\r\r\r\r\r\r\r\n\r\n\n\n\n\r\r\n\n\r\r\n\r\n\n\r\n\r\n\r\r\n\r\n\r\n\n
GPU requerido para el tiempo de entrenamiento práctico: En un RTX 3080 (10GB), 80.000 pasos toman aproximadamente 90 minutos. En un RTX 4090, aproximadamente 50 minutos. En CPU, espere 10
Leer curvas de entrenamiento bimanual
Las curvas de entrenamiento bimanual difieren de las curvas de entrenamiento de un solo brazo en un aspecto importante: usted tiene dos espacios de acción, y la política debe aprender a coordinarlos.
La reconstrucción (perdida total de acción)
Se debe disminuir de ~ 3,0 a menos de 0,4 por 60.000 pasos. Una meseta superior a 0,7 después de 40,000 pasos indica problemas de calidad del conjunto de datos
L_kl (regularización de la EAC)
El CVAE se encuentra en dificultades para encontrar una incorporación de estilo compacto. Esto a menudo significa que sus demostraciones tienen demasiada diversidad de comportamiento.
Erro de acción: izquierda vs derecha
Si habilita el registro de errores de acción por brazo (a través de la superposición
Hiperparámetros específicos de dos manuales
| Parameter | Default (single-arm) | DK1 Bimanual Recommended | Why |
|---|---|---|---|
action_dim |
7 | 14 | Two 6-DOF arms + 2 grippers = 14 action dimensions |
chunk_size |
100 | 100 | Same — action chunking is already well-suited to bimanual coordination timescales |
dim_feedforward |
3200 | 3200 | No change needed — the larger action space is handled by the action head, not the transformer width |
num_steps |
50000 | 80000 | Bimanual coordination requires more training steps to converge reliably; 80k is the practical minimum for 100 demos |
batch_size |
32 | 16 | Reduced to fit the larger bimanual dataset samples (dual camera feeds) in GPU memory |
kl_weight |
10 | 10 | Default works well; increase to 20 only if L_kl stays near zero after 30k steps (CVAE not learning) |
Selección de los puntos de control
El sistema de control de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de información de la información de la información de la información de la información de información de la información de la información de la información de la información de información de la información de la información de la información de la información de la información de la información de la información de información de la información de la información de la información de la información de la información de la información de la información de la información.
Seleccione el punto de control en el paso en el que
Unidad 5 completa cuando...
El entrenamiento ha completado 80.000 pasos y los puntos de control se guardan en
[← Regreso a la visión general del camino]







