Zurück zu Booster K1 Path

Zug und Einsatz

Trainieren Sie eine gesamte Körper-Imitierungs-Lernpolitik auf Ihrem Booster K1-Datensatz und deploy es live.

Einheit 5 von 5 · Zug & Einsatz · ~ 6 Stunden

Sie können eine gesamte Körper-Imitierungs-Lernpolitik auf Ihrem Datensatz ausbilden, in Simulationen bewerten und mit Sicherheit überwachen, um das echte K1 zu entwickeln.

Schritt 1: Umwandeln Sie Ihren Datensatz in LeRobot-Format

python convert_k1_to_lerobot.py \
  --input-dir ./recordings/session_001/ \
  --output-dir ./dataset/k1-pick-place/ \
  --repo-id your-username/k1-pick-place \
  --success-only  # filters to episodes labeled success=true

Schritt 2: Schulen mit Diffusionspolitik

Die Diffusion Policy funktioniert gut für Ganzkörper-Aufgaben, da sie mehrmodal-Aktionsverteilungen verwaltet und reibungslose Bahnen erzeugt.

python -m lerobot.scripts.train \
  --dataset_repo_id=your-username/k1-pick-place \
  --policy.type=diffusion \
  --policy.obs_as_global_cond=true \
  --training.num_epochs=300 \
  --training.batch_size=64 \
  --output_dir=./checkpoints/k1-diffusion-v1

# Monitor training (open in browser)
tensorboard --logdir=./checkpoints/k1-diffusion-v1/logs/

Beobachten Sie die Kurven des Ausbildungsverlusts und des Validierungsverlusts. Das Training ist abgeschlossen, wenn der Validierungsverlust mindestens 20 Epochen lang festgesetzt ist.

Schritt 3: Beurteilung in MuJoCo Simulation

python eval_policy_sim.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --env=booster_gym/envs/pick_place.py \
  --num_episodes=20 \
  --render

Ziel: ≥ 60% Erfolgsrate bei der Simulation vor dem Einsatz in die echte Hardware. Wenn weniger als 60% ist, sammeln Sie mehr Demonstrationen (kehren Sie zur Einheit 4) oder überprüfen Sie die Datenqualität.

Schritt 4: Live-Deployment auf der echten K1

Alle Sicherheitsprotokolle gelten während der Ausführung der Politik. Beobachter vorhanden, e-Stop getestet, 3 m × 3 m reine Fläche.

python deploy_policy.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --robot-ip=192.168.10.102 \
  --cameras head_cam,external \
  --task "pick up the red block" \
  --max-episode-duration=30 \
  --safety-monitor=true

Die T5-Flagge ermöglicht automatische Rückfall-DAMP-Anlagen, wenn die Gelenkschwindigkeiten oder Drehmomente die Sicherheitsschwellen überschreiten.

Beurteilung Ihrer Politik

20 Bewertungsversuche durchführen, um eine statistisch sinnvolle Erfolgsrate zu erzielen:

python eval_policy_live.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --robot-ip=192.168.10.102 \
  --num-trials=20 \
  --log-results=./eval_results/k1-diffusion-v1-eval.json

Für jede Prüfung wird die Szene in die gleiche Startkonfiguration wie bei den Trainingsdemonstrationen zurückgesetzt. Das Erfolgs-/Fehlerresultat und der Ausfallmodus für versagte Versuche werden aufgenommen.

Das Daten-Flugrad

Nach Ihrem ersten Einsatz:

  1. Identifizieren Sie Ihre drei größten Fehlermodi aus den Evaluierungsprotokollen.
  2. Erfassen Sie gezielte Demonstrationen, die diese Ausfallmodi abdecken (zurück zur Einheit 4).
  3. Mischen Sie neue Episoden mit Ihrem ursprünglichen Datensatz (50/50 oder mit Gewichtung für Fehler).
  4. Erholen Sie, bis Sie Ihre Ziel-Erfolgsrate erreichen.

Einheit 5 ist fertig, wenn...

Sie haben eine ausgebildete Diffusion Policy oder ACT Checkpoint mit einer Erfolgsrate von ≥60% in der Simulation. Sie haben sie live auf die K1 eingesetzt und mindestens 10 Evaluierungsversuche in der realen Welt durchgeführt. Sie haben Ihre wichtigsten Fehlermodi identifiziert und einen Plan für Ihre nächste Datenerhebungseinheit.

Der Weg ist vollständig

Sie haben sich vom sicheren Power-On zu einer funktionierenden Ganzkörper-Imitierungs-Lernpolitik auf dem Booster K1 entwickelt. Teilen Sie Ihre Ergebnisse im [RCSV Forum]T6) und tragen Sie Ihren Datensatz in das [Datensatzregister]T7 ein.

[← Zurück zu Wegübersicht]