Volver a DK1 Path

Entrenar una política bimanual con ACT

Unidad 5 de la ruta de aprendizaje bimanual DK1. Cree una política ACT en su conjunto de datos bimanual. ¿Por qué ACT sobresale en bimanual, comando de entrenamiento, lectura de curvas de entrenamiento, hiperparámetros. ~ 4 horas.

Unidad 5 de 6 · Formación en política · ~4 horas

Lanzar el entrenamiento ACT en su conjunto de datos bimanual sincronizado, entender las curvas bimanual de entrenamiento, y saber cuándo tiene un punto de control que vale la pena desplegar en la Unidad 6.

Por qué ACT es excelente en tareas bimanual

ACT (Action Chunked Transformers) fue desarrollado originalmente específicamente para la investigación de manipulación bimanual. Su visión central que predecir secuencias de acciones futuras (partes) en lugar de acciones de un solo paso reduce el error de composición es especialmente valioso para tareas bimanual, donde un pequeño error en la trayectoria de un brazo puede causar un fallo en cascada en la ejecución del otro brazo.

El mecanismo de acción de desmontaje proporciona a la política un horizonte de planificación. En lugar de comprometerse con un solo comando conjunto en cada paso de tiempo de 50 Hz, ACT planifica 100 pasos por delante y suaviza la ejecución. Para una tarea de entrega, esto significa que la política puede "ver" el acercamiento de ambos brazos hacia el punto de entrega como parte de una secuencia planificada, en lugar de reaccionar a cada marco de forma independiente. Empiricamente, esto reduce a la mitad la tasa de fallos de transferencia media en comparación con los enfoques no fragmentados en conjuntos de datos bimanual.

Una advertencia: ACT asume que las demostraciones en su conjunto de datos representan una estrategia consistente. Si diferentes demostraciones muestran formas fundamentalmente diferentes de ejecutar la entrega diferentes brazos que inician, diferentes altura de entrega el componente CVAE tendrá dificultades para codificar un solo estilo. Sus 100 demostraciones deben ejecutar la misma estrategia de movimiento.

Comando de entrenamiento

fuente ~/dk1-env/bin/activar python -m lerobot.scripts.train \ --policy-type act \ --dataset-repo-id cube-handoff-v1 \ --root ~/dk1-datasets \ --output-dir ~/dk1-policies/cube-handoff-v1 \ --config-overrides \ policy.action_dim=14 \ policy.chunk_size=100 \ policy.n\action_steps=100 \ policy.dim_feedforward=3200 \ policy.n\heads=8 \ policy.n\encoder=4 \ save.n_decoder=7 training.number\steps=80000\dimensional training.frequency training.\\quickness training.\quickness training.\quickness training.\quickness training.\quickness training.\quickness training.\quickness training.\quickness training.\quickness training.\quickness training.\quickness training.\\quickness training.\\quickness training.\\quickness training.\\\quickness training.\\\\\r\r\r\r\r\r\r\r\r\r\r\r\r\r\n\r\n\n\n\n\r\r\n\n\r\r\n\r\n\n\r\n\r\n\r\r\n\r\n\r\n\n

GPU requerido para el tiempo de entrenamiento práctico: En un RTX 3080 (10GB), 80.000 pasos toman aproximadamente 90 minutos. En un RTX 4090, aproximadamente 50 minutos. En CPU, espere 1014 horas. Utilice la bandera T0 si tiene una GPU. Opciones de GPU en la nube (Lambda Labs, Vast.ai) funcionan alrededor de $0.501.50/hora para el hardware necesario.

Leer curvas de entrenamiento bimanual

Las curvas de entrenamiento bimanual difieren de las curvas de entrenamiento de un solo brazo en un aspecto importante: usted tiene dos espacios de acción, y la política debe aprender a coordinarlos.

La reconstrucción (perdida total de acción)

Se debe disminuir de ~ 3,0 a menos de 0,4 por 60.000 pasos. Una meseta superior a 0,7 después de 40,000 pasos indica problemas de calidad del conjunto de datos probablemente demasiada variación en el tiempo o posición de entrega.

L_kl (regularización de la EAC)

El CVAE se encuentra en dificultades para encontrar una incorporación de estilo compacto. Esto a menudo significa que sus demostraciones tienen demasiada diversidad de comportamiento.

Erro de acción: izquierda vs derecha

Si habilita el registro de errores de acción por brazo (a través de la superposición T2), verá curvas de pérdida separadas para las dimensiones de acción izquierda y derecha. Una gran brecha persistente entre los dos indica que las demostraciones de un brazo son más consistentes que las de otro revisa su lista de verificación de calidad de la Unidad 4 para el brazo atrasado.

Hiperparámetros específicos de dos manuales

Parameter Default (single-arm) DK1 Bimanual Recommended Why
action_dim 7 14 Two 6-DOF arms + 2 grippers = 14 action dimensions
chunk_size 100 100 Same — action chunking is already well-suited to bimanual coordination timescales
dim_feedforward 3200 3200 No change needed — the larger action space is handled by the action head, not the transformer width
num_steps 50000 80000 Bimanual coordination requires more training steps to converge reliably; 80k is the practical minimum for 100 demos
batch_size 32 16 Reduced to fit the larger bimanual dataset samples (dual camera feeds) in GPU memory
kl_weight 10 10 Default works well; increase to 20 only if L_kl stays near zero after 30k steps (CVAE not learning)

Selección de los puntos de control

El sistema de control de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de información de la información de la información de la información de la información de la información de la información de la información de la información de la información de la información de información de la información de la información de la información de la información de información de la información de la información de la información de la información de información de la información de la información de la información de la información de la información de la información de la información de información de la información de la información de la información de la información de la información de la información de la información de la información.

Seleccione el punto de control en el paso en el que T10 alcanzó su mínimo antes de comenzar a subir o aumentar ligeramente. Por lo general, este está en el rango de pasos de 60,00080,000 para conjuntos de datos bimanual de 100 demostraciones.

Unidad 5 completa cuando...

El entrenamiento ha completado 80.000 pasos y los puntos de control se guardan en T11. El valor final T12 es inferior a 0.5. Usted ha identificado su mejor punto de control basado en las curvas de pérdida. Usted entiende por qué la curva L_kl se comporta como lo hace en su carrera. Está listo para implementarse en hardware real en la Unidad 6 La tasa de éxito objetivo en la entrega de cubo es >60% (el manual es más difícil que el de un solo brazo, y este es un fuerte resultado de primera ejecución).

[← Regreso a la visión general del camino]