Tren y despliegue
Entrenar una política de aprendizaje de imitación de todo el cuerpo en su conjunto de datos Booster K1 y implementarlo en vivo. Flujo de trabajo de entrenamiento, métricas de evaluación y protocolo de implementación en vivo seguro.
Unidad 5 de 5 · Tren y despliegue · ~ 6 horas
Entrenar una política de aprendizaje de imitación de todo el cuerpo en su conjunto de datos, evaluarlo en simulación y implementarlo en el K1 real con monitoreo de seguridad.
Paso 1: Convierta su conjunto de datos a formato LeRobot
python convert_k1_to_lerobot.py \
--input-dir ./recordings/session_001/ \
--output-dir ./dataset/k1-pick-place/ \
--repo-id your-username/k1-pick-place \
--success-only # filters to episodes labeled success=true
Paso 2: Entrenamiento con política de difusión
La política de difusión funciona bien para tareas de todo el cuerpo porque maneja distribuciones de acción multimodal y produce trayectorias suaves.
python -m lerobot.scripts.train \
--dataset_repo_id=your-username/k1-pick-place \
--policy.type=diffusion \
--policy.obs_as_global_cond=true \
--training.num_epochs=300 \
--training.batch_size=64 \
--output_dir=./checkpoints/k1-diffusion-v1
# Monitor training (open in browser)
tensorboard --logdir=./checkpoints/k1-diffusion-v1/logs/
Observe las curvas de pérdida de entrenamiento y pérdida de validación. El entrenamiento se completa cuando la pérdida de validación se ha aplazado durante al menos 20 épocas.
Paso 3: Evalúa en la simulación MuJoCo
python eval_policy_sim.py \
--checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
--env=booster_gym/envs/pick_place.py \
--num_episodes=20 \
--render
Objetivo: ≥60% de éxito en la simulación antes de ser implementada en hardware real. Si es inferior al 60%, recoger más demostraciones (volver a la Unidad 4) o verificar la calidad de sus datos.
Paso 4: Despliegue en vivo en el K1 real
python deploy_policy.py \
--checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
--robot-ip=192.168.10.102 \
--cameras head_cam,external \
--task "pick up the red block" \
--max-episode-duration=30 \
--safety-monitor=true
La bandera
Evaluar su política
Realice 20 ensayos de evaluación para obtener una tasa de éxito estadísticamente significativa:
python eval_policy_live.py \
--checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
--robot-ip=192.168.10.102 \
--num-trials=20 \
--log-results=./eval_results/k1-diffusion-v1-eval.json
Para cada ensayo, restablezca la escena a la misma configuración de inicio que sus demostraciones de entrenamiento. Registre el resultado de éxito/fallo y el modo de fallo para los ensayos fallidos.
El volante de datos
Después de su primer despliegue:
- Identifique sus tres principales modos de falla de los registros de evaluación.
- Recoger demostraciones específicas que cubran esos modos de falla (retorno a la Unidad 4).
- Mezcla nuevos episodios con el conjunto de datos original (50/50 o ponderados hacia fallos).
- Reentren y vuelvan a evaluar, repitan hasta que alcancen su tasa de éxito objetivo.
Unidad 5 completa cuando...
Usted tiene un punto de control de la Política de Difusión o ACT capacitado que alcanza una tasa de éxito ≥60% en la simulación. Lo ha implementado en vivo en el K1 y ejecutado al menos 10 ensayos de evaluación en el mundo real. Ha identificado sus principales modos de falla y tiene un plan para su próxima sesión de recopilación de datos.
El camino completo
Ha pasado de ser un sistema de alimentación segura a una política de aprendizaje de imitación de todo el cuerpo en el Booster K1. Comparte sus resultados en el [Foro RCSV]
[← Volver a la visión general del camino]







