Entrenad su política
Unidad 5 de la ruta de aprendizaje OpenArm. Entrenar una política de aprendizaje de imitación ACT en su conjunto de datos. Comprender las curvas de entrenamiento, saber cuándo parar, y alcanzar una tasa de éxito de 70% +. ~ 3 horas.
Unidad 5 de 6 · Formación en política · ~ 3 horas
Envía tu conjunto de datos de 50 demostraciones al entrenador ACT, vigila las curvas de entrenamiento y detente en el punto de control correcto.
Lo que realmente hace el aprendizaje por imitación
Antes de ejecutar el comando de entrenamiento, tome dos minutos para entender lo que el modelo está aprendiendo en realidad. La red nunca recibe una señal de recompensa
ACT (Action Chunking with Transformers) predice una parte de 100 acciones futuras a la vez en lugar de un solo paso. Esto evita la acumulación de errores a lo largo del episodio: incluso si una predicción individual está ligeramente fuera, el pedazo proporciona un amortiguador de trayectoria estable. Luego replanea cada 100 pasos de tiempo (2 segundos a 50Hz).
Para obtener el fondo teórico completo, lea [Fundamentos de aprendizaje por imitación]
¿GPU o CPU?
El entrenamiento en una GPU NVIDIA con 8GB + VRAM toma aproximadamente 45 minutos para 100k pasos. El entrenamiento en CPU toma 3
Entrenar ACT en su conjunto de datos
Ejecutar el guión de entrenamiento desde su entorno virtual. Los valores de configuración a continuación están calibrados para conjuntos de datos de 50 episodios de selección y ubicación en OpenArm
fuente ~/openarm-env/bin/activar python -m lerobot.scripts.train \ --dataset-path ~/openarm-datasets/pick-and-place \ --policies act \ --batch-size 8 \ --lr 1e-5 \ --num-train-steps 100000 \ --eval-freq 5000 \ --save-freq 10000 \ --log-freq 500 \ --output-dir ~/openarm-policy/pick-and-place-v1 # La capacitación imprimirá pérdidas cada 500 pasos y evaluará resultados cada 5000 \ # Los puntos de control guardados cada 10k pasos hasta ~/openarm-policy/pick-and-place-v1/
Comience el entrenamiento, luego vigile la salida. No es necesario verlo todo el tiempo
Comprender las curvas de formación
El resultado de la formación del ACT muestra dos métricas clave: aprende a leerlas correctamente
Perdida de formación
Las pérdidas que se encuentran en las mesas de estudio de la Universidad de Chicago, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el año de la década de 1970 y en el año, en el año, en el estado de la cual el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año,
Taxa de éxito igual
Aparece cada 5K pasos (requiere un brazo físico o sim). Este es el número que realmente importa. Quiere que esto sea superior al 70% antes de desplegar. A menudo se retrasa la pérdida de entrenamiento
Acción MSE
El MSE de acción alta después de 80k pasos significa que el modelo está luchando con la complejidad de la tarea o sus datos son inconsistentes.
KL Divergencia (específica del ACT)
ACT utiliza un CVAE con un peso KL que se anula de 0 a 10 durante el entrenamiento.
Cuándo dejar de entrenar
No corra hasta 100 mil pasos y detenga.
- La tasa de éxito igual se ha mantenido estable durante 3 evaluaciones consecutivas
el modelo se ha convergido. - La tasa de éxito igual es superior al 70%
este es el umbral para el despliegue de la Unidad 6. Si alcanzas el 70% a 60k pasos, puedes detenerte temprano y desplegar ese punto de control. - La pérdida de entrenamiento sigue disminuyendo pero la evaluación es plana o decrece
el modelo está sobreajustado. - ** Después de 100 mil pasos**
si la tasa de éxito es inferior al 40%, vuelva a la Unidad 4.
Envases profundos opcionales
Más allá del ACT Política de difusión y π0
Una vez que se tiene una política de ACT en funcionamiento, el siguiente experimento natural es la Política de difusión. Se encarga mejor de tareas multimodales (por ejemplo, el brazo puede acercarse al objeto desde dos ángulos) a costa de una inferencia más lenta. La sección de Investigación RCSV cubre ambas cosas.
Unidad 5 completa cuando...
El nivel de éxito de la evaluación es superior al 70% en la tarea de selección y ubicación. Usted tiene un punto de control guardado en
[← Volver a la visión general del camino]







