Zurück zu OpenArm Path

Schulen Sie Ihre erste Politik

Einheit 5 des OpenArm-Lernpfads. Trainieren Sie eine ACT-Imitierungslernpolitik auf Ihrem Datensatz. Verstanden Sie die Trainingskurven, wissen Sie, wann Sie aufhören müssen, und erreichen Sie 70% + Erfolgsrate. ~ 3 Stunden.

Einheit 5 von 6 · Politikbildung · ~ 3 Stunden

Führen Sie Ihren 50-Demo-Datensatz in den ACT-Trainer ein, überwachen Sie die Trainingskurven und halten Sie an der richtigen Kontrollstelle an. Ziel: eine Politik, die mehr als 70% der Zeit bei Ihrer Testarbeit erfolgreich ist.

Was das Nachbilden tatsächlich tut

Vor dem Ausführen des Trainingsbefehls nehmen Sie sich zwei Minuten Zeit, um zu verstehen, was das Modell tatsächlich lernt. Das Netzwerk empfängt nie ein Belohnungssignal, es sieht nur Ihre Demonstrationen und lernt, die Verteilung der von Ihnen in ähnlichen Zuständen ausgeführten Aktionen zu reproduzieren.

ACT (Action Chunking with Transformers) prognostiziert einen Teil von 100 zukünftigen Aktionen auf einmal statt eines einzigen Schritts. Dies verhindert Fehlerammelung in der gesamten Episode: Selbst wenn eine individuelle Vorhersage leicht aus ist, bietet der Teil einen stabilen Bahnpuffer.

Für den vollständigen theoretischen Hintergrund lesen Sie [Imitiations Learning Fundamentals]T1) in der Robotikbibliothek.

GPU oder CPU?

Das Training auf einer NVIDIA GPU mit 8GB+ VRAM dauert ungefähr 45 Minuten für 100k Schritte. Das Training auf der CPU dauert 34 Stunden für den gleichen Betrieb. Beide produzieren gleichwertige Modellqualität GPU ist einfach schneller. Wenn Sie keine lokale GPU haben, funktioniert der Training-Befehl identisch auf einer Cloud-Instanz (Lambda Labs oder Google Colab mit A100-Lauftakt).

ACT auf Ihrem Datensatz

Führen Sie das Trainingscript aus Ihrer virtuellen Umgebung aus. Die nachfolgenden Konfigurationswerte werden für 50-Episoden-Pick-and-Place-Datensätze auf OpenArm kalibriert.

Quelle ~/openarm-env/bin/activate python -m lerobot.scripts.train \ --dataset-path ~/openarm-datasets/pick-and-place \ --policy act \ --batch-size 8 \ --lr 1e-5 \ --num-train-steps 100000 \ --eval-freq 5000 \ --save-freq 10000 \ --log-freq 500 \ --output-dir ~/openarm-policy/pick-and-place-v1 # Das Training wird Verlust alle 500 Schritte drucken und Ergebnisse alle 5000 Schritte evaluieren

Sie müssen nicht die ganze Zeit beobachten, sondern alle 20 30 Minuten überprüfen, um zu bestätigen, dass der Verlust abnimmt und der Lauf nicht abgestürzt ist.

Verständnis für Schulungskurven

Die Ausbildungsleistung des ACT zeigt zwei wichtige Kennzahlen: Lernen Sie sie richtig zu lesen Sie sagen Ihnen, ob Ihr Training gesund ist und wann Sie aufhören sollten.

Verlust von Ausbildung

Ein Verlust, der mit einem Plateau über 0,05 normalerweise auf Datenqualitätsprobleme hinweist Überprüfen Sie Ihren Datensatz. Ein Verlust, der weitgehend schwingt, deutet darauf hin, dass Ihre Lernrate zu hoch ist.

Gleiches Erfolgsniveau

Es erscheint alle 5k Schritte (erfordert einen physischen Arm oder Sim). Dies ist die Zahl, die wirklich zählt. Sie wollen, dass dies über 70% vor dem Einsatz. Es verlässt oft den Training Verlust der Verlust kann gut aussehen, während die Erfolgsrate noch verbessert wird.

Aktion MSE

Durchschnittlicher Quadratfehler zwischen vorhergesagten und grundlegenden Wahrheitsaktionen. Für eine gut ausgebildete Pick-and-Place-Politik sollte der Wert unter 0,01 fallen.

KL-Divergenz (AKT-spezifisch)

ACT verwendet ein CVAE mit einem KL-Gewicht, das während des Trainings von 0 bis 10 angeschnitten wird. Achten Sie darauf, dass sich diese Stabilisierung um Schritt 40k herum stabilisiert. Wenn sie nie konvergiert, versagt das Modell bei der Kodierung.

Wann man aufhören sollte

Verwenden Sie diese Signale, um zu entscheiden, wann Ihr Checkpoint bereit ist:

  • Die gleiche Erfolgsrate ist für 3 aufeinanderfolgende Bewertungen festgestellt Das Modell ist konvergiert.
  • Evalue Erfolgsrate ist über 70% Dies ist die Schwelle für die Einsatzbereitschaft der Einheit 6. Wenn Sie bei 60k Schritten 70% erreichen, können Sie frühzeitig aufhören und diesen Checkpoint einsetzen.
  • Training-Verlust nimmt immer noch ab, aber eval ist flach oder abnimmt das Modell ist überpassend. Nehmen Sie den letzten Checkpoint, wo eval auf seinem Höhepunkt war. Dies ist der beste Checkpoint.
  • Nach 100 000 Schritten wenn die Erfolgsrate unter 40% liegt, kehren Sie zur Einheit 4 zurück.

Optional tiefste Tauchgänge

Über die Akte hinaus Diffusionspolitik und π0

Wenn Sie eine funktionierende ACT-Politik haben, ist das nächste Experiment die Diffusion Policy. Es verwaltet mehrmodal-tätigkeiten besser (z. B. kann der Arm sich dem Objekt aus zwei Winkeln nähern) zu Kosten einer langsameren Ableitung.

Einheit 5 ist fertig, wenn...

Sie haben einen gespeicherten Checkpoint bei T0 und wissen, welche Schrittnummer Ihr bestes Ergebnis erzielt hat. Sie sind bereit, diese Politik in der Einheit 6 auf den richtigen Arm zu setzen.

[← Zurück zu Wegübersicht]