Zug und Einsatz
Trainieren Sie eine gesamte Körper-Imitierungs-Lernpolitik auf Ihrem Booster K1-Datensatz und deploy es live.
Einheit 5 von 5 · Zug & Einsatz · ~ 6 Stunden
Sie können eine gesamte Körper-Imitierungs-Lernpolitik auf Ihrem Datensatz ausbilden, in Simulationen bewerten und mit Sicherheit überwachen, um das echte K1 zu entwickeln.
Schritt 1: Umwandeln Sie Ihren Datensatz in LeRobot-Format
python convert_k1_to_lerobot.py \
--input-dir ./recordings/session_001/ \
--output-dir ./dataset/k1-pick-place/ \
--repo-id your-username/k1-pick-place \
--success-only # filters to episodes labeled success=true
Schritt 2: Schulen mit Diffusionspolitik
Die Diffusion Policy funktioniert gut für Ganzkörper-Aufgaben, da sie mehrmodal-Aktionsverteilungen verwaltet und reibungslose Bahnen erzeugt.
python -m lerobot.scripts.train \
--dataset_repo_id=your-username/k1-pick-place \
--policy.type=diffusion \
--policy.obs_as_global_cond=true \
--training.num_epochs=300 \
--training.batch_size=64 \
--output_dir=./checkpoints/k1-diffusion-v1
# Monitor training (open in browser)
tensorboard --logdir=./checkpoints/k1-diffusion-v1/logs/
Beobachten Sie die Kurven des Ausbildungsverlusts und des Validierungsverlusts. Das Training ist abgeschlossen, wenn der Validierungsverlust mindestens 20 Epochen lang festgesetzt ist.
Schritt 3: Beurteilung in MuJoCo Simulation
python eval_policy_sim.py \
--checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
--env=booster_gym/envs/pick_place.py \
--num_episodes=20 \
--render
Ziel: ≥ 60% Erfolgsrate bei der Simulation vor dem Einsatz in die echte Hardware. Wenn weniger als 60% ist, sammeln Sie mehr Demonstrationen (kehren Sie zur Einheit 4) oder überprüfen Sie die Datenqualität.
Schritt 4: Live-Deployment auf der echten K1
python deploy_policy.py \
--checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
--robot-ip=192.168.10.102 \
--cameras head_cam,external \
--task "pick up the red block" \
--max-episode-duration=30 \
--safety-monitor=true
Die
Beurteilung Ihrer Politik
20 Bewertungsversuche durchführen, um eine statistisch sinnvolle Erfolgsrate zu erzielen:
python eval_policy_live.py \
--checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
--robot-ip=192.168.10.102 \
--num-trials=20 \
--log-results=./eval_results/k1-diffusion-v1-eval.json
Für jede Prüfung wird die Szene in die gleiche Startkonfiguration wie bei den Trainingsdemonstrationen zurückgesetzt. Das Erfolgs-/Fehlerresultat und der Ausfallmodus für versagte Versuche werden aufgenommen.
Das Daten-Flugrad
Nach Ihrem ersten Einsatz:
- Identifizieren Sie Ihre drei größten Fehlermodi aus den Evaluierungsprotokollen.
- Erfassen Sie gezielte Demonstrationen, die diese Ausfallmodi abdecken (zurück zur Einheit 4).
- Mischen Sie neue Episoden mit Ihrem ursprünglichen Datensatz (50/50 oder mit Gewichtung für Fehler).
- Erholen Sie, bis Sie Ihre Ziel-Erfolgsrate erreichen.
Einheit 5 ist fertig, wenn...
Sie haben eine ausgebildete Diffusion Policy oder ACT Checkpoint mit einer Erfolgsrate von ≥60% in der Simulation. Sie haben sie live auf die K1 eingesetzt und mindestens 10 Evaluierungsversuche in der realen Welt durchgeführt. Sie haben Ihre wichtigsten Fehlermodi identifiziert und einen Plan für Ihre nächste Datenerhebungseinheit.
Der Weg ist vollständig
Sie haben sich vom sicheren Power-On zu einer funktionierenden Ganzkörper-Imitierungs-Lernpolitik auf dem Booster K1 entwickelt. Teilen Sie Ihre Ergebnisse im [RCSV Forum]
[← Zurück zu Wegübersicht]







