Tren y despliegue
Entrenar una política de ACT o difusión en su conjunto de datos O6 y implementarlo en vivo. Flujo de trabajo de entrenamiento, protocolo de evaluación y el volante de datos para una mejora continua. ~ 3 horas.
Unidad 5 de 5 · Trenes y despliegue · ~ 3 horas
Entrenar una política de aprendizaje de imitación en su conjunto de datos de 50 episodios, evaluarlo fuera de línea y implementarlo en vivo en el O6.
Elige una arquitectura de políticas
Recomendado para principiantes
ACT (Acción de la pieza con transformadores)
Formación rápida (1
Política de difusión
Formación más lenta (3
Paso 1: Entrenamiento con ACT
python -m lerobot.scripts.train \
--dataset_repo_id=your-username/o6-pick-place \
--policy.type=act \
--policy.chunk_size=100 \
--training.num_epochs=200 \
--training.batch_size=32 \
--training.lr=1e-4 \
--output_dir=./checkpoints/o6-act-v1
# Monitor training loss
tensorboard --logdir=./checkpoints/o6-act-v1/logs/
El entrenamiento ACT se estabiliza típicamente dentro de 100
Paso 2: Evaluación fuera de línea
Antes de implementar en el hardware, evalúe el punto de control de los episodios retrasados de su conjunto de datos:
python -m lerobot.scripts.eval \
--pretrained_policy_name_or_path=./checkpoints/o6-act-v1 \
--env.type=linker_bot_o6_sim \
--eval.n_episodes=20 \
--eval.batch_size=10
Si su entorno no tiene un modelo sim, utilice el evaluador de reproducción de conjuntos de datos en su lugar:
python -m lerobot.scripts.visualize_dataset \
--repo-id your-username/o6-pick-place \
--episode-index 0 \
--policy-checkpoint ./checkpoints/o6-act-v1
Paso 3: Despliegue en vivo en el O6
python -m lerobot.scripts.control_robot \
--robot.type=linker_bot_o6 \
--control.type=evaluate \
--pretrained_policy_name_or_path=./checkpoints/o6-act-v1 \
--control.fps=30 \
--control.num_episodes=20 \
--control.episode_time_s=30
Para cada ensayo:
- Coloque el objeto en la posición de inicio estándar.
- Confirme que el brazo está en posición de casa.
- No intervienes a menos que el brazo esté a punto de entrar en contacto con sí mismo o con la montaña.
- Registra el éxito (composición completada) o el fracaso, y nota el modo de fracaso.
Interpretación de los resultados
| Success Rate | Action |
|---|---|
| ≥70% | Path complete. Share your results and contribute your dataset. |
| 50–69% | Collect 20–30 more episodes targeting your top failure mode. Retrain. |
| Below 50% | Review dataset quality. Check camera alignment and starting position consistency. Consider a simpler task variant. |
El volante de datos
Mejora continua después de su primer despliegue:
- Identifique sus principales modos de falla 2
3 en el registro de evaluación. - Recoger 20
30 demostraciones específicas que cubran esas fallas. - Mezcla nuevos episodios con el conjunto de datos original (50/50 o peso hacia fallos).
- Reentrenamiento desde cero (no desde el punto de control
El nuevo entrenamiento evita el olvido catastrófico en pequeños conjuntos de datos). - Reevaluar, repetir hasta alcanzar la tasa de éxito objetivo.
Compartir los resultados
# Push your trained policy to HuggingFace Hub
python -m lerobot.scripts.push_policy_to_hub \
--pretrained_policy_path=./checkpoints/o6-act-v1 \
--repo-id=your-username/o6-pick-place-act
Unidad 5 completa cuando...
Su punto de control ACT (o Política de difusión) alcanza una tasa de éxito ≥70% en 20 ensayos de evaluación en vivo en el O6. Ha registrado todos los resultados de los ensayos e identificado los modos de falla restantes. Su conjunto de datos y el punto de control de políticas se hacen copias de seguridad y se comparten opcionalmente en HuggingFace Hub.
El camino completo
Ha pasado de descabar el LinkerBot O6 a una política de aprendizaje de imitación en producción. Comparte sus resultados en el [Foro RCSV]
[← Regreso a la visión general del camino]







