Schulen Sie Ihre erste Politik
Einheit 5 des OpenArm-Lernpfads. Trainieren Sie eine ACT-Imitierungslernpolitik auf Ihrem Datensatz. Verstanden Sie die Trainingskurven, wissen Sie, wann Sie aufhören müssen, und erreichen Sie 70% + Erfolgsrate. ~ 3 Stunden.
Einheit 5 von 6 · Politikbildung · ~ 3 Stunden
Führen Sie Ihren 50-Demo-Datensatz in den ACT-Trainer ein, überwachen Sie die Trainingskurven und halten Sie an der richtigen Kontrollstelle an. Ziel: eine Politik, die mehr als 70% der Zeit bei Ihrer Testarbeit erfolgreich ist.
Was das Nachbilden tatsächlich tut
Vor dem Ausführen des Trainingsbefehls nehmen Sie sich zwei Minuten Zeit, um zu verstehen, was das Modell tatsächlich lernt. Das Netzwerk empfängt nie ein Belohnungssignal, es sieht nur Ihre Demonstrationen und lernt, die Verteilung der von Ihnen in ähnlichen Zuständen ausgeführten Aktionen zu reproduzieren.
ACT (Action Chunking with Transformers) prognostiziert einen Teil von 100 zukünftigen Aktionen auf einmal statt eines einzigen Schritts. Dies verhindert Fehlerammelung in der gesamten Episode: Selbst wenn eine individuelle Vorhersage leicht aus ist, bietet der Teil einen stabilen Bahnpuffer.
Für den vollständigen theoretischen Hintergrund lesen Sie [Imitiations Learning Fundamentals]
GPU oder CPU?
Das Training auf einer NVIDIA GPU mit 8GB+ VRAM dauert ungefähr 45 Minuten für 100k Schritte. Das Training auf der CPU dauert 3
ACT auf Ihrem Datensatz
Führen Sie das Trainingscript aus Ihrer virtuellen Umgebung aus. Die nachfolgenden Konfigurationswerte werden für 50-Episoden-Pick-and-Place-Datensätze auf OpenArm kalibriert.
Quelle ~/openarm-env/bin/activate python -m lerobot.scripts.train \ --dataset-path ~/openarm-datasets/pick-and-place \ --policy act \ --batch-size 8 \ --lr 1e-5 \ --num-train-steps 100000 \ --eval-freq 5000 \ --save-freq 10000 \ --log-freq 500 \ --output-dir ~/openarm-policy/pick-and-place-v1 # Das Training wird Verlust alle 500 Schritte drucken und Ergebnisse alle 5000 Schritte evaluieren
Sie müssen nicht die ganze Zeit beobachten, sondern alle 20
Verständnis für Schulungskurven
Die Ausbildungsleistung des ACT zeigt zwei wichtige Kennzahlen: Lernen Sie sie richtig zu lesen
Verlust von Ausbildung
Ein Verlust, der mit einem Plateau über 0,05 normalerweise auf Datenqualitätsprobleme hinweist
Gleiches Erfolgsniveau
Es erscheint alle 5k Schritte (erfordert einen physischen Arm oder Sim). Dies ist die Zahl, die wirklich zählt. Sie wollen, dass dies über 70% vor dem Einsatz. Es verlässt oft den Training Verlust
Aktion MSE
Durchschnittlicher Quadratfehler zwischen vorhergesagten und grundlegenden Wahrheitsaktionen. Für eine gut ausgebildete Pick-and-Place-Politik sollte der Wert unter 0,01 fallen.
KL-Divergenz (AKT-spezifisch)
ACT verwendet ein CVAE mit einem KL-Gewicht, das während des Trainings von 0 bis 10 angeschnitten wird. Achten Sie darauf, dass sich diese Stabilisierung um Schritt 40k herum stabilisiert. Wenn sie nie konvergiert, versagt das Modell bei der Kodierung.
Wann man aufhören sollte
Verwenden Sie diese Signale, um zu entscheiden, wann Ihr Checkpoint bereit ist:
- Die gleiche Erfolgsrate ist für 3 aufeinanderfolgende Bewertungen festgestellt
Das Modell ist konvergiert. - Evalue Erfolgsrate ist über 70%
Dies ist die Schwelle für die Einsatzbereitschaft der Einheit 6. Wenn Sie bei 60k Schritten 70% erreichen, können Sie frühzeitig aufhören und diesen Checkpoint einsetzen. - Training-Verlust nimmt immer noch ab, aber eval ist flach oder abnimmt
das Modell ist überpassend. Nehmen Sie den letzten Checkpoint, wo eval auf seinem Höhepunkt war. Dies ist der beste Checkpoint. - Nach 100 000 Schritten
wenn die Erfolgsrate unter 40% liegt, kehren Sie zur Einheit 4 zurück.
Optional tiefste Tauchgänge
Über die Akte hinaus Diffusionspolitik und π0
Wenn Sie eine funktionierende ACT-Politik haben, ist das nächste Experiment die Diffusion Policy. Es verwaltet mehrmodal-tätigkeiten besser (z. B. kann der Arm sich dem Objekt aus zwei Winkeln nähern) zu Kosten einer langsameren Ableitung.
Einheit 5 ist fertig, wenn...
Sie haben einen gespeicherten Checkpoint bei
[← Zurück zu Wegübersicht]







