Volver a Booster K1 Path

Tren y despliegue

Entrenar una política de aprendizaje de imitación de todo el cuerpo en su conjunto de datos Booster K1 y implementarlo en vivo. Flujo de trabajo de entrenamiento, métricas de evaluación y protocolo de implementación en vivo seguro.

Unidad 5 de 5 · Tren y despliegue · ~ 6 horas

Entrenar una política de aprendizaje de imitación de todo el cuerpo en su conjunto de datos, evaluarlo en simulación y implementarlo en el K1 real con monitoreo de seguridad.

Paso 1: Convierta su conjunto de datos a formato LeRobot

python convert_k1_to_lerobot.py \
  --input-dir ./recordings/session_001/ \
  --output-dir ./dataset/k1-pick-place/ \
  --repo-id your-username/k1-pick-place \
  --success-only  # filters to episodes labeled success=true

Paso 2: Entrenamiento con política de difusión

La política de difusión funciona bien para tareas de todo el cuerpo porque maneja distribuciones de acción multimodal y produce trayectorias suaves.

python -m lerobot.scripts.train \
  --dataset_repo_id=your-username/k1-pick-place \
  --policy.type=diffusion \
  --policy.obs_as_global_cond=true \
  --training.num_epochs=300 \
  --training.batch_size=64 \
  --output_dir=./checkpoints/k1-diffusion-v1

# Monitor training (open in browser)
tensorboard --logdir=./checkpoints/k1-diffusion-v1/logs/

Observe las curvas de pérdida de entrenamiento y pérdida de validación. El entrenamiento se completa cuando la pérdida de validación se ha aplazado durante al menos 20 épocas.

Paso 3: Evalúa en la simulación MuJoCo

python eval_policy_sim.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --env=booster_gym/envs/pick_place.py \
  --num_episodes=20 \
  --render

Objetivo: ≥60% de éxito en la simulación antes de ser implementada en hardware real. Si es inferior al 60%, recoger más demostraciones (volver a la Unidad 4) o verificar la calidad de sus datos.

Paso 4: Despliegue en vivo en el K1 real

Todos los protocolos de seguridad se aplican durante la implementación de la política. Detector presente, prueba de parada electrónica, área limpia de 3 m × 3 m. Durante la primera carrera en vivo, mantenga su mano en la parada electrónica. La política puede generar movimientos inesperados en los casos de borde.

python deploy_policy.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --robot-ip=192.168.10.102 \
  --cameras head_cam,external \
  --task "pick up the red block" \
  --max-episode-duration=30 \
  --safety-monitor=true

La bandera T5 permite la retroceso automático de la DAMP si las velocidades o torques conjuntos superan los umbrales de seguridad.

Evaluar su política

Realice 20 ensayos de evaluación para obtener una tasa de éxito estadísticamente significativa:

python eval_policy_live.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --robot-ip=192.168.10.102 \
  --num-trials=20 \
  --log-results=./eval_results/k1-diffusion-v1-eval.json

Para cada ensayo, restablezca la escena a la misma configuración de inicio que sus demostraciones de entrenamiento. Registre el resultado de éxito/fallo y el modo de fallo para los ensayos fallidos.

El volante de datos

Después de su primer despliegue:

  1. Identifique sus tres principales modos de falla de los registros de evaluación.
  2. Recoger demostraciones específicas que cubran esos modos de falla (retorno a la Unidad 4).
  3. Mezcla nuevos episodios con el conjunto de datos original (50/50 o ponderados hacia fallos).
  4. Reentren y vuelvan a evaluar, repitan hasta que alcancen su tasa de éxito objetivo.

Unidad 5 completa cuando...

Usted tiene un punto de control de la Política de Difusión o ACT capacitado que alcanza una tasa de éxito ≥60% en la simulación. Lo ha implementado en vivo en el K1 y ejecutado al menos 10 ensayos de evaluación en el mundo real. Ha identificado sus principales modos de falla y tiene un plan para su próxima sesión de recopilación de datos.

El camino completo

Ha pasado de ser un sistema de alimentación segura a una política de aprendizaje de imitación de todo el cuerpo en el Booster K1. Comparte sus resultados en el [Foro RCSV]T6) y contribuye con su conjunto de datos al [registro de conjunto de datos]T7).

[← Volver a la visión general del camino]