Zurück zu OpenArm Path

Verteilen und verbessern

Einheit 6 des OpenArm-Lernpfades. Führen Sie Ihre ausgebildete Politik auf dem realen Arm durch, bewerten Sie sie systematisch und starten Sie das Datenruder. Ziel: 7/10 autonome Erfolgsrate.

Einheit 6 von 6 · Bereitstellung und Verbesserung · ~ 1,5 Stunden

Sie haben eine ausgebildete Politik. Jetzt setzen Sie sie auf den richtigen Arm, bewerten Sie sie streng und verstehen Sie, wie Sie sie verbessern können. Hier beginnt das Daten-Flugrad.

Die wahre Hand ist ein Schlagwort

Die Ausführung bedeutet, den ausgebildeten Checkpoint in Echtzeit zu betreiben, Live-Kamera und gemeinsame Beobachtungen in das Netzwerk zu füttern und die Ausgabeaktionen auf dem physischen Arm auszuführen.

Quelle ~/openarm-env/bin/activate # Stellen Sie sicher, dass ROS 2 läuft (realer Hardware-Modus, von Einheit 1) Python -m lerobot.scripts.eval \ --policy-checkpoint ~/openarm-policy/pick-and-place-v1/checkpoint_XXXXX \ --device cuda \ --num-eval-episodes 10 \ --record-video \ --output-dir ~/openarm-s/v1 \ # Ersetzen Sie XXXXX mit Ihrem besten Checkpoint-Schrittnummer von Einheit 5 \ # --record-video speichert jede Episode als mp4 für die Überprüfung

Beim ersten Einsatzlauf halten Sie Ihre Hand in der Nähe des physischen E-Stops. Eine frisch eingesetzte Politik kann gelegentlich unerwartete Bewegungen machen, während sie sich in der realen Hardwareumgebung erwärmt. Dies ist normal für die ersten 23 Episoden. Danach sollte sich das Verhalten stabilisieren.

Für umfassende Anleitungen zum Einsatz und zur Produktion einschließlich Sicherheitsumschläge und Wachhundstifter siehe [OpenArm Production Guide]T1).

Bewertungstechnik

Verwenden Sie ein strukturiertes Protokoll es ist der einzige Weg zu wissen, ob eine Änderung, die Sie vornehmen (mehr Daten, unterschiedliche Checkpoints, unterschiedliche Aufgabenrahmen) tatsächlich die Leistung verbessert:

Protocol Item Specification
Number of episodes per evaluation 10 minimum, 20 for high-confidence results
Object starting position Fixed. Use tape marks. Same position every episode.
Object type Same object as training. Lighting must match training conditions.
What counts as success Object placed within 3cm of target. Arm returns to home. No human intervention during episode.
Failure classification Log failure type: missed grasp / dropped object / wrong target / timeout. This tells you what to fix.
Report metric Success rate = successful episodes / total episodes. Report with episode count (e.g., "7/10 = 70%").

Das Daten-Flugrad: Wie man besser wird

Eine Politik, die 7/10 Mal erfolgreich ist, ist ein guter Anfang aber der Weg zu 9/10 oder darüber hinaus ist durch das Daten-Fliegrad.

1

Sammeln

Aufzeichnen Sie Demonstrationen, einschließlich Fehlerfälle, mit denen Ihre derzeitige Politik kämpft.

2 .

Zug

Retrain (oder Fein-Tune) auf Ihrem erweiterten Datensatz mit den neuen Demonstrationen hinzugefügt

3

Beurteilung

  • Haben sich die Erfolgsraten verbessert?

4

Analyse

Sehen Sie sich die Fehlervideos an, identifizieren Sie den spezifischen Zustand, in dem die Richtlinie kaputt geht, sammeln Sie dort gezielte Daten.

Die wichtigste Erkenntnis des Flugrads: Zieldaten übertreffen zufällige Daten. Anstatt 50 weitere zufällige Demonstrationen aufzunehmen, schauen Sie sich Ihre Fehlervideos an und identifizieren Sie den genauen Moment, in dem etwas schief geht. Ihre Erfolgsrate wird sich mit 20 gezielten Demo's schneller verbessern als mit 50 zufälligen.

Häufige Fehler und wie sie behoben werden

  • Arm überschreitet die Grip-Position: Die Aktionsstücke der Politik sind zu groß oder Ihre Daten hatten eine hohe Geschwindigkeitsvarianz.
  • Arm gelingt beim Training Objekt, scheitert aber bei leicht anderen Objekten: Ihre Trainingsdaten fehlten der Positionsvielfalt des Objekts.
  • Politik eiskaltet oder produziert wiederholte Bewegungen: Die CVAE-Stilvariable kollabiert. Dies bedeutet oft, dass Ihr Datensatz zu viel Variation hat Das Modell kann keinen konsistenten Stil finden. Überprüfen Sie gemischte Demonstrationen (verschiedene Operatoren, verschiedene Aufgabenrahmen) und reinigen Sie Ihren Datensatz.

Einheit 6 vollendet, wenn...

Sie haben die 3 Fehlervideos gesehen und identifiziert, was schiefgelaufen ist. Sie verstehen das Datenrollen gut genug, um Ihre nächste Verbesserung zu planen. Dies ist das Ende des strukturierten Weges , aber es ist der Anfang Ihrer Roboter-Lernpraxis.

Du hast es geschafft.

Sie haben von der Entkartelung eines Robots zur Ausbildung und Einführung einer echten Praxis des Imitationslernens übergegangen. Das bringt Sie vor 99% der Menschen, die jemals einen Roboterarm berührt haben. Was Sie hier aufgebaut haben die Teleoperations-Einstellung, die Datenleitung, den Trainings-Workflow Skalen für jede Aufgabe und jede Hardware.

Was kommt als Nächstes?

Sie haben die Grundlagen.

  • Ich weiß .

OpenArm Produktionsführer

Sicherheitsumschläge, Wachhund-Timer, mehrfacharmige Einstellungen und langfristige Einsatzmuster.

](T2) [

Die Kommission hat die Kommission mit der Kommission übermittelt.

Schulen Sie auf mehrmodalen Aufgaben, bei denen mehrere Strategien gültig sind.

](T3) [

DK1 Bimanual Kit

Zwei synchronisierte Arme für zweimanschließende Aufgaben.

](T4)

Teilen Sie Ihre Ergebnisse mit

Veröffentlichen Sie Ihre Erfolgsrate, Ihre Datensätze und Ihre Richtlinien im OpenArm-Forum.

](T5)

[← Zurück zu Wegübersicht]