Zurück zu LeRobot Path

Eine Politik ausbilden

Einheit 4 des LeRobot-Lernpfads. Wählen Sie zwischen ACT, Diffusion Policy und SmolVLA.

Einheit 4 von 6 · Zugpolitik · ~ 3 Stunden

Wählen Sie eine Richtlinienarchitektur aus, starten Sie Training auf Ihrem Datensatz, interpretieren Sie die Trainingsprotokolle und speichern Sie einen Checkpoint, der bereit ist, in der Einheit 5 eingesetzt zu werden.

Politiken

LeRobot liefert drei Produktionsarchitekturen.

Für diesen Weg empfohlen

ACT

Aktions-Tranformatoren, die für eine geschickte Handhabung mit einem Arm geeignet sind, in 1 3 Stunden auf GPU trainieren, vorhersehbare Hyperparameter.

Diffusionspolitik

Höhere Höchstgenauigkeit bei Präzisionsarbeiten, aber 35x langsamer zum Ausbilden und Ableiten.

Schmelz

VLA mit Sprachkonditionierung. Benutzen Sie, wenn Ihre Aufgabe natürliche Sprachanweisungen oder eine Mehrtasksgeneralisierung erfordert. Mehr Daten benötigt.

ACT-Ausbildungsbefehl

Ersetzen Sie T0 mit Ihrer Repo-ID für Datensätze aus der Einheit 3.

Quelle ~/lerobot-env/bin/activate python -m lerobot.scripts.train \ --policy-type act \ --dataset-repo-id $HF_USER/pick-place-v1 \ --output-dir ~/lerobot-policy/pick-place-v1 \ --config-overrides \ training.num_steps=50000 \ training.evval_freq=5000 \ training.save GPU_freq=5000 \ training.batch_size=32 \ policy.chunk_size=100 \ policy.n_action_steps=100 # Add --device cuda, wenn Sie eine (stärkt empfohlen) \ Checkpoint alle 5k Schritte zu schlafen ~/obotlerot-steps/pick-v1/1# Startpolicy

GPU vs CPU Trainingszeit: Auf einem RTX 3090 (24GB) dauert 50.000 Schritte ungefähr 6080 Minuten. Auf einem RTX 3080 (10GB) dauert es ungefähr 90120 Minuten. Auf der CPU erwarten Sie 812 Stunden. Cloud GPU Optionen (Lambda Labs, Vast.ai) laufen für die benötigte Hardware 0,501,50 USD/Stunde.

Empfohlene Hyperparameter für einarmige Auswahl- und Verlagerung

Parameter Recommended Why
num_steps 50000 Sufficient for 50–100 demos of a simple pick-and-place. Increase to 80k if your loss plateau occurs late.
batch_size 32 Standard for single-arm datasets. Reduce to 16 if you run out of GPU memory.
chunk_size 100 ACT plans 100 steps ahead. At 30fps this is ~3.3 seconds — a good planning horizon for pick-and-place.
n_action_steps 100 Must match chunk_size. Reduces inference frequency and smooths execution.
kl_weight 10 LeRobot default. Do not change unless L_kl stays near zero after 20k steps.
lr 1e-5 LeRobot default for ACT. Lower to 5e-6 if reconstruction loss oscillates instead of converging.

Lesen von Schulungsprotokollen

Ausbildungsprotokolle auf das Terminal und auf TensorBoard gedruckt.

  • die Veröffentlichung von Informationen über die

Dann öffnen Sie T1 in Ihrem Browser.

Verlust/Wiederherstellung (L_Recon)

Das primäre Trainingssignal. Sollte von ~ 2,53,5 auf unter 0,1 um 50.000 Schritte sinken. Ein Plateau über 0,15 nach 40.000 Schritten bedeutet in der Regel, dass Ihr Datensatz zu viel Variation hat.

Verlust/kl (L_kl)

Diese Verhalten ist zu erwarten. Das CVAE lernt eine kompakte Stil-Einbetten. Wenn es über 40 liegt, enthalten Ihre Demonstrationen zu viel Verhaltensvielfalt. Wenn es nach 20k Schritten in der Nähe von 0 bleibt, lernt das CVAE nicht; erhöhen Sie kl_gewicht auf 20.

Zug/Verlust (Gesamtverlust)

L_recon + kl_gewicht × L_kl. Beherrscht von L_recon im frühen Training. Soll monotonisch sinken. Ein Gesamtverlust, der nach einem ersten Rückgang steigt, zeigt, dass der Lernrate-Verfall zu aggressiv ist Überprüfen Sie die Scheduler-Konfiguration.

Kontrollpunktmanagement

Die Kontrollpunkte speichern alle 5.000 Schritte auf T2. Nehmen Sie nicht an, dass der letzte Kontrollpunkt der beste ist. Die Politik kann bei hohen Schrittenzahlen, insbesondere bei kleinen Datensätzen, überschritten werden.

Nach dem Training identifizieren Sie Ihren besten Checkpoint: Es ist der Schritt, bei dem die L__Reconstruction vor Beginn des Plateau-Aufbaus ihr Minimum erreicht hat. Bei 50 Demonstrationen findet dies typischerweise im Schrittbereich von 35.00050.000 statt.

Einheit 4 ist fertig, wenn...

Die Ausbildung hat 50.000 Schritte abgeschlossen und Kontrollpunkte werden in T3 gespeichert. Der endgültige L_Reconstruction-Verlust liegt unter 0,1°. Sie haben Ihren besten Kontrollpunktschritt basierend auf den Verlustkurven identifiziert. Sie verstehen, was L_kl in Ihrem Training macht. Sie sind bereit, die Politik in Einheit 5 zu bewerten.

[← Zurück zum Wegüberblick]