Volver a OpenArm Path

Entrenad su política

Unidad 5 de la ruta de aprendizaje OpenArm. Entrenar una política de aprendizaje de imitación ACT en su conjunto de datos. Comprender las curvas de entrenamiento, saber cuándo parar, y alcanzar una tasa de éxito de 70% +. ~ 3 horas.

Unidad 5 de 6 · Formación en política · ~ 3 horas

Envía tu conjunto de datos de 50 demostraciones al entrenador ACT, vigila las curvas de entrenamiento y detente en el punto de control correcto.

Lo que realmente hace el aprendizaje por imitación

Antes de ejecutar el comando de entrenamiento, tome dos minutos para entender lo que el modelo está aprendiendo en realidad. La red nunca recibe una señal de recompensa sólo ve sus demostraciones y aprende a reproducir la distribución de las acciones que realizó en estados similares.

ACT (Action Chunking with Transformers) predice una parte de 100 acciones futuras a la vez en lugar de un solo paso. Esto evita la acumulación de errores a lo largo del episodio: incluso si una predicción individual está ligeramente fuera, el pedazo proporciona un amortiguador de trayectoria estable. Luego replanea cada 100 pasos de tiempo (2 segundos a 50Hz).

Para obtener el fondo teórico completo, lea [Fundamentos de aprendizaje por imitación]T1) en la Biblioteca de Robótica.

¿GPU o CPU?

El entrenamiento en una GPU NVIDIA con 8GB + VRAM toma aproximadamente 45 minutos para 100k pasos. El entrenamiento en CPU toma 34 horas para la misma ejecución. Ambos producen un modelo equivalente de calidad GPU es solo más rápido. Si no tienes una GPU local, el comando de entrenamiento funciona idénticamente en una instancia de nube (Lambda Labs o Google Colab con A100 runtime).

Entrenar ACT en su conjunto de datos

Ejecutar el guión de entrenamiento desde su entorno virtual. Los valores de configuración a continuación están calibrados para conjuntos de datos de 50 episodios de selección y ubicación en OpenArm no los cambie para su primera ejecución:

fuente ~/openarm-env/bin/activar python -m lerobot.scripts.train \ --dataset-path ~/openarm-datasets/pick-and-place \ --policies act \ --batch-size 8 \ --lr 1e-5 \ --num-train-steps 100000 \ --eval-freq 5000 \ --save-freq 10000 \ --log-freq 500 \ --output-dir ~/openarm-policy/pick-and-place-v1 # La capacitación imprimirá pérdidas cada 500 pasos y evaluará resultados cada 5000 \ # Los puntos de control guardados cada 10k pasos hasta ~/openarm-policy/pick-and-place-v1/

Comience el entrenamiento, luego vigile la salida. No es necesario verlo todo el tiempo , pero revise cada 2030 minutos para confirmar que la pérdida está disminuyendo y que la carrera no se ha estrellado.

Comprender las curvas de formación

El resultado de la formación del ACT muestra dos métricas clave: aprende a leerlas correctamente te dicen si tu entrenamiento es saludable y cuándo parar.

Perdida de formación

Las pérdidas que se encuentran en las mesas de estudio de la Universidad de Chicago, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el estado de California, en el año de la década de 1970 y en el año, en el año, en el estado de la cual el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año, en el año,

Taxa de éxito igual

Aparece cada 5K pasos (requiere un brazo físico o sim). Este es el número que realmente importa. Quiere que esto sea superior al 70% antes de desplegar. A menudo se retrasa la pérdida de entrenamiento la pérdida puede verse bien mientras la tasa de éxito sigue mejorando.

Acción MSE

El MSE de acción alta después de 80k pasos significa que el modelo está luchando con la complejidad de la tarea o sus datos son inconsistentes.

KL Divergencia (específica del ACT)

ACT utiliza un CVAE con un peso KL que se anula de 0 a 10 durante el entrenamiento.

Cuándo dejar de entrenar

No corra hasta 100 mil pasos y detenga.

  • La tasa de éxito igual se ha mantenido estable durante 3 evaluaciones consecutivas el modelo se ha convergido.
  • La tasa de éxito igual es superior al 70% este es el umbral para el despliegue de la Unidad 6. Si alcanzas el 70% a 60k pasos, puedes detenerte temprano y desplegar ese punto de control.
  • La pérdida de entrenamiento sigue disminuyendo pero la evaluación es plana o decrece el modelo está sobreajustado.
  • ** Después de 100 mil pasos** si la tasa de éxito es inferior al 40%, vuelva a la Unidad 4.

Envases profundos opcionales

Más allá del ACT Política de difusión y π0

Una vez que se tiene una política de ACT en funcionamiento, el siguiente experimento natural es la Política de difusión. Se encarga mejor de tareas multimodales (por ejemplo, el brazo puede acercarse al objeto desde dos ángulos) a costa de una inferencia más lenta. La sección de Investigación RCSV cubre ambas cosas.

Unidad 5 completa cuando...

El nivel de éxito de la evaluación es superior al 70% en la tarea de selección y ubicación. Usted tiene un punto de control guardado en T0 y sabe cuál número de pasos ha producido su mejor resultado. Está listo para poner esta política en el brazo real en la Unidad 6.

[← Volver a la visión general del camino]