Eine Politik ausbilden
Einheit 4 des LeRobot-Lernpfads. Wählen Sie zwischen ACT, Diffusion Policy und SmolVLA.
Einheit 4 von 6 · Zugpolitik · ~ 3 Stunden
Wählen Sie eine Richtlinienarchitektur aus, starten Sie Training auf Ihrem Datensatz, interpretieren Sie die Trainingsprotokolle und speichern Sie einen Checkpoint, der bereit ist, in der Einheit 5 eingesetzt zu werden.
Politiken
LeRobot liefert drei Produktionsarchitekturen.
Für diesen Weg empfohlen
ACT
Aktions-Tranformatoren, die für eine geschickte Handhabung mit einem Arm geeignet sind, in 1 3 Stunden auf GPU trainieren, vorhersehbare Hyperparameter.
Diffusionspolitik
Höhere Höchstgenauigkeit bei Präzisionsarbeiten, aber 3
Schmelz
VLA mit Sprachkonditionierung. Benutzen Sie, wenn Ihre Aufgabe natürliche Sprachanweisungen oder eine Mehrtasksgeneralisierung erfordert. Mehr Daten benötigt.
ACT-Ausbildungsbefehl
Ersetzen Sie
Quelle ~/lerobot-env/bin/activate python -m lerobot.scripts.train \ --policy-type act \ --dataset-repo-id $HF_USER/pick-place-v1 \ --output-dir ~/lerobot-policy/pick-place-v1 \ --config-overrides \ training.num_steps=50000 \ training.evval_freq=5000 \ training.save GPU_freq=5000 \ training.batch_size=32 \ policy.chunk_size=100 \ policy.n_action_steps=100 # Add --device cuda, wenn Sie eine (stärkt empfohlen) \ Checkpoint alle 5k Schritte zu schlafen ~/obotlerot-steps/pick-v1/1# Startpolicy
GPU vs CPU Trainingszeit: Auf einem RTX 3090 (24GB) dauert 50.000 Schritte ungefähr 60
Empfohlene Hyperparameter für einarmige Auswahl- und Verlagerung
| Parameter | Recommended | Why |
|---|---|---|
| num_steps | 50000 | Sufficient for 50–100 demos of a simple pick-and-place. Increase to 80k if your loss plateau occurs late. |
| batch_size | 32 | Standard for single-arm datasets. Reduce to 16 if you run out of GPU memory. |
| chunk_size | 100 | ACT plans 100 steps ahead. At 30fps this is ~3.3 seconds — a good planning horizon for pick-and-place. |
| n_action_steps | 100 | Must match chunk_size. Reduces inference frequency and smooths execution. |
| kl_weight | 10 | LeRobot default. Do not change unless L_kl stays near zero after 20k steps. |
| lr | 1e-5 | LeRobot default for ACT. Lower to 5e-6 if reconstruction loss oscillates instead of converging. |
Lesen von Schulungsprotokollen
Ausbildungsprotokolle auf das Terminal und auf TensorBoard gedruckt.
- die Veröffentlichung von Informationen über die
Dann öffnen Sie
Verlust/Wiederherstellung (L_Recon)
Das primäre Trainingssignal. Sollte von ~ 2,5
Verlust/kl (L_kl)
Diese Verhalten ist zu erwarten.
Zug/Verlust (Gesamtverlust)
L_recon + kl_gewicht × L_kl. Beherrscht von L_recon im frühen Training. Soll monotonisch sinken. Ein Gesamtverlust, der nach einem ersten Rückgang steigt, zeigt, dass der Lernrate-Verfall zu aggressiv ist
Kontrollpunktmanagement
Die Kontrollpunkte speichern alle 5.000 Schritte auf
Nach dem Training identifizieren Sie Ihren besten Checkpoint: Es ist der Schritt, bei dem die L__Reconstruction vor Beginn des Plateau-Aufbaus ihr Minimum erreicht hat. Bei 50 Demonstrationen findet dies typischerweise im Schrittbereich von 35.000
Einheit 4 ist fertig, wenn...
Die Ausbildung hat 50.000 Schritte abgeschlossen und Kontrollpunkte werden in
[← Zurück zum Wegüberblick]







