Entrenando una política
Unidad 4 de la ruta de aprendizaje de LeRobot. Elige entre ACT, Política de difusión y SmolVLA. Entrenar una política de ACT en tu conjunto de datos, leer registros de entrenamiento, gestionar los puestos de control. ~ 3 horas.
Unidad 4 de 6 · Política de trenes · ~ 3 horas
Seleccione una arquitectura de política, inicie un entrenamiento en su conjunto de datos, interprete los registros de entrenamiento y guarde un punto de control listo para ser implementado en la Unidad 5.
Las opciones políticas
LeRobot ofrece tres arquitecturas de políticas listas para la producción.
Recomendado para este camino
Acta
Transformadores de acción, mejores para la manipulación de un brazo.
Política de difusión
Una mayor precisión de máxima precisión en tareas de precisión, pero 3
El producto
VLA con lenguaje condicionado. Utilice cuando su tarea requiere instrucciones de lenguaje natural o generalización de múltiples tareas. Requiere más datos.
Comando de entrenamiento ACT
Reemplazar
fuente ~/lerobot-env/bin/activar python -m lerobot.scripts.train \ --politic-type act \ --dataset-repo-id $HF_USER/pick-place-v1 \ --output-dir ~/lerobot-policy/pick-place-v1 \ --config-overrides \ training.num_steps=50000 \ training.eval_freq=5000 \ training.save GPU_freq=5000 \ training.batch_size=32 \ policy.chunk_size=100 \ policy.n_action_steps=100 # Add --device cuda si tiene un (fuertemente recomendado) \ Checkpoint cada 5k a los pasos de ~/lerobot-steps/pick-v1/1 # Start-up #start\series\1\1\1\1\1\1\1\1\1\
**Tempo de entrenamiento de GPU en un RTX 3090 (24GB), 50,000 pasos toman aproximadamente 60
Hiperparámetros recomendados para el pick-and-place de un solo brazo
| Parameter | Recommended | Why |
|---|---|---|
| num_steps | 50000 | Sufficient for 50–100 demos of a simple pick-and-place. Increase to 80k if your loss plateau occurs late. |
| batch_size | 32 | Standard for single-arm datasets. Reduce to 16 if you run out of GPU memory. |
| chunk_size | 100 | ACT plans 100 steps ahead. At 30fps this is ~3.3 seconds — a good planning horizon for pick-and-place. |
| n_action_steps | 100 | Must match chunk_size. Reduces inference frequency and smooths execution. |
| kl_weight | 10 | LeRobot default. Do not change unless L_kl stays near zero after 20k steps. |
| lr | 1e-5 | LeRobot default for ACT. Lower to 5e-6 if reconstruction loss oscillates instead of converging. |
Leer los registros de formación
Imprimir los registros de entrenamiento en la terminal y en TensorBoard.
Tensorboard --logdir ~/Lerobot-policies/
Luego abre
pérdida/reconstrucción (L_reconstrucción)
La señal de entrenamiento primario. Debe disminuir de ~ 2,5
pérdida/kl (L_kl)
Se eleva lentamente de cerca de 0 a 5
tren/perdida (perdida total)
L_recon + kl_peso × L_kl. Dominado por L_recon en el entrenamiento temprano. Debe disminuir monótona. Una pérdida total que aumenta después de una disminución inicial indica que la disminución de la tasa de aprendizaje es demasiado agresiva
Gestión de los puntos de control
Los puntos de control guardan cada 5.000 pasos hasta
Después del entrenamiento, identifique su mejor punto de control: es el paso en el que la L_reconstrucción alcanzó su mínimo antes de comenzar a la meseta. Para 50 demostraciones, esto ocurre típicamente en el rango de pasos de 35.000
Unidad 4 completa cuando...
El entrenamiento ha completado 50.000 pasos y los puntos de control se guardan en
[← Regreso a la visión general del camino]







