Volver a LinkerBot O6 Path

Tren y despliegue

Entrenar una política de ACT o difusión en su conjunto de datos O6 y implementarlo en vivo. Flujo de trabajo de entrenamiento, protocolo de evaluación y el volante de datos para una mejora continua. ~ 3 horas.

Unidad 5 de 5 · Trenes y despliegue · ~ 3 horas

Entrenar una política de aprendizaje de imitación en su conjunto de datos de 50 episodios, evaluarlo fuera de línea y implementarlo en vivo en el O6.

Elige una arquitectura de políticas

Recomendado para principiantes

ACT (Acción de la pieza con transformadores)

Formación rápida (12 h en 16 GB GPU). Excelente para tareas de pick-and-place y de horizonte corto. La opción predeterminada para la manipulación de la mesa O6.

Política de difusión

Formación más lenta (35 h) pero maneja mejor las distribuciones de acción multimodal.

Paso 1: Entrenamiento con ACT

python -m lerobot.scripts.train \
  --dataset_repo_id=your-username/o6-pick-place \
  --policy.type=act \
  --policy.chunk_size=100 \
  --training.num_epochs=200 \
  --training.batch_size=32 \
  --training.lr=1e-4 \
  --output_dir=./checkpoints/o6-act-v1

# Monitor training loss
tensorboard --logdir=./checkpoints/o6-act-v1/logs/

El entrenamiento ACT se estabiliza típicamente dentro de 100 150 épocas en un conjunto de datos de 50 episodios.

Paso 2: Evaluación fuera de línea

Antes de implementar en el hardware, evalúe el punto de control de los episodios retrasados de su conjunto de datos:

python -m lerobot.scripts.eval \
  --pretrained_policy_name_or_path=./checkpoints/o6-act-v1 \
  --env.type=linker_bot_o6_sim \
  --eval.n_episodes=20 \
  --eval.batch_size=10

Si su entorno no tiene un modelo sim, utilice el evaluador de reproducción de conjuntos de datos en su lugar:

python -m lerobot.scripts.visualize_dataset \
  --repo-id your-username/o6-pick-place \
  --episode-index 0 \
  --policy-checkpoint ./checkpoints/o6-act-v1

Paso 3: Despliegue en vivo en el O6

python -m lerobot.scripts.control_robot \
  --robot.type=linker_bot_o6 \
  --control.type=evaluate \
  --pretrained_policy_name_or_path=./checkpoints/o6-act-v1 \
  --control.fps=30 \
  --control.num_episodes=20 \
  --control.episode_time_s=30

Para cada ensayo:

  1. Coloque el objeto en la posición de inicio estándar.
  2. Confirme que el brazo está en posición de casa.
  3. No intervienes a menos que el brazo esté a punto de entrar en contacto con sí mismo o con la montaña.
  4. Registra el éxito (composición completada) o el fracaso, y nota el modo de fracaso.

Interpretación de los resultados

Success Rate Action
≥70% Path complete. Share your results and contribute your dataset.
50–69% Collect 20–30 more episodes targeting your top failure mode. Retrain.
Below 50% Review dataset quality. Check camera alignment and starting position consistency. Consider a simpler task variant.

El volante de datos

Mejora continua después de su primer despliegue:

  1. Identifique sus principales modos de falla 23 en el registro de evaluación.
  2. Recoger 20 30 demostraciones específicas que cubran esas fallas.
  3. Mezcla nuevos episodios con el conjunto de datos original (50/50 o peso hacia fallos).
  4. Reentrenamiento desde cero (no desde el punto de control El nuevo entrenamiento evita el olvido catastrófico en pequeños conjuntos de datos).
  5. Reevaluar, repetir hasta alcanzar la tasa de éxito objetivo.

Compartir los resultados

# Push your trained policy to HuggingFace Hub
python -m lerobot.scripts.push_policy_to_hub \
  --pretrained_policy_path=./checkpoints/o6-act-v1 \
  --repo-id=your-username/o6-pick-place-act

Unidad 5 completa cuando...

Su punto de control ACT (o Política de difusión) alcanza una tasa de éxito ≥70% en 20 ensayos de evaluación en vivo en el O6. Ha registrado todos los resultados de los ensayos e identificado los modos de falla restantes. Su conjunto de datos y el punto de control de políticas se hacen copias de seguridad y se comparten opcionalmente en HuggingFace Hub.

El camino completo

Ha pasado de descabar el LinkerBot O6 a una política de aprendizaje de imitación en producción. Comparte sus resultados en el [Foro RCSV]T5) y contribuya con su conjunto de datos al [registro de conjunto de datos]T6).

[← Regreso a la visión general del camino]