Volver a LeRobot Path

Entrenando una política

Unidad 4 de la ruta de aprendizaje de LeRobot. Elige entre ACT, Política de difusión y SmolVLA. Entrenar una política de ACT en tu conjunto de datos, leer registros de entrenamiento, gestionar los puestos de control. ~ 3 horas.

Unidad 4 de 6 · Política de trenes · ~ 3 horas

Seleccione una arquitectura de política, inicie un entrenamiento en su conjunto de datos, interprete los registros de entrenamiento y guarde un punto de control listo para ser implementado en la Unidad 5.

Las opciones políticas

LeRobot ofrece tres arquitecturas de políticas listas para la producción.

Recomendado para este camino

Acta

Transformadores de acción, mejores para la manipulación de un brazo.

Política de difusión

Una mayor precisión de máxima precisión en tareas de precisión, pero 35 veces más lenta para entrenar y inferir.

El producto

VLA con lenguaje condicionado. Utilice cuando su tarea requiere instrucciones de lenguaje natural o generalización de múltiples tareas. Requiere más datos.

Comando de entrenamiento ACT

Reemplazar T0 con el ID de repos del conjunto de datos de la Unidad 3.

fuente ~/lerobot-env/bin/activar python -m lerobot.scripts.train \ --politic-type act \ --dataset-repo-id $HF_USER/pick-place-v1 \ --output-dir ~/lerobot-policy/pick-place-v1 \ --config-overrides \ training.num_steps=50000 \ training.eval_freq=5000 \ training.save GPU_freq=5000 \ training.batch_size=32 \ policy.chunk_size=100 \ policy.n_action_steps=100 # Add --device cuda si tiene un (fuertemente recomendado) \ Checkpoint cada 5k a los pasos de ~/lerobot-steps/pick-v1/1 # Start-up #start\series\1\1\1\1\1\1\1\1\1\

**Tempo de entrenamiento de GPU en un RTX 3090 (24GB), 50,000 pasos toman aproximadamente 6080 minutos. En un RTX 3080 (10GB), aproximadamente 90120 minutos. En la CPU, espere 812 horas. Opciones de GPU en la nube (Lambda Labs, Vast.ai) funcionan $0.501.50 / hora para el hardware necesario.

Hiperparámetros recomendados para el pick-and-place de un solo brazo

Parameter Recommended Why
num_steps 50000 Sufficient for 50–100 demos of a simple pick-and-place. Increase to 80k if your loss plateau occurs late.
batch_size 32 Standard for single-arm datasets. Reduce to 16 if you run out of GPU memory.
chunk_size 100 ACT plans 100 steps ahead. At 30fps this is ~3.3 seconds — a good planning horizon for pick-and-place.
n_action_steps 100 Must match chunk_size. Reduces inference frequency and smooths execution.
kl_weight 10 LeRobot default. Do not change unless L_kl stays near zero after 20k steps.
lr 1e-5 LeRobot default for ACT. Lower to 5e-6 if reconstruction loss oscillates instead of converging.

Leer los registros de formación

Imprimir los registros de entrenamiento en la terminal y en TensorBoard.

Tensorboard --logdir ~/Lerobot-policies/

Luego abre T1 en su navegador. Observe estas curvas:

pérdida/reconstrucción (L_reconstrucción)

La señal de entrenamiento primario. Debe disminuir de ~ 2,53.5 a menos de 0,1 por 50.000 pasos. Una meseta superior a 0,15 después de 40,000 pasos generalmente significa que su conjunto de datos tiene demasiada variación revise las buenas prácticas de demostración de la Unidad 3 y considere grabar demostraciones más consistentes.

pérdida/kl (L_kl)

Se eleva lentamente de cerca de 0 a 520. Este es el comportamiento esperado el CVAE está aprendiendo un estilo de incorporación compacto. Si supera los 40, sus demostraciones contienen demasiada diversidad de comportamiento. Si se queda cerca de 0 después de 20k pasos, el CVAE no está aprendiendo; aumentar el kl_peso a 20.

tren/perdida (perdida total)

L_recon + kl_peso × L_kl. Dominado por L_recon en el entrenamiento temprano. Debe disminuir monótona. Una pérdida total que aumenta después de una disminución inicial indica que la disminución de la tasa de aprendizaje es demasiado agresiva comprobar la configuración del programador.

Gestión de los puntos de control

Los puntos de control guardan cada 5.000 pasos hasta T2. No asuma que el punto de control final es el mejor. La política puede sobresalir en el conteo de pasos, especialmente con conjuntos de datos pequeños.

Después del entrenamiento, identifique su mejor punto de control: es el paso en el que la L_reconstrucción alcanzó su mínimo antes de comenzar a la meseta. Para 50 demostraciones, esto ocurre típicamente en el rango de pasos de 35.00050.000. Guarde este número de pasos lo utilizará en la Unidad 5.

Unidad 4 completa cuando...

El entrenamiento ha completado 50.000 pasos y los puntos de control se guardan en T3. La pérdida final de reconstrucción de L__reconstrucción es inferior a 0.1. Usted ha identificado su mejor paso de control basado en las curvas de pérdida. Usted entiende lo que L_kl está haciendo en su carrera de entrenamiento. Usted está listo para evaluar la política en la Unidad 5.

[← Regreso a la visión general del camino]