Zurück zu DK1 Path

Führen Sie Ihre Bimanuale Politik durch und verbessern Sie sie

Einheit 6 des DK1-Bimanual-Lern-Pfades.

Einheit 6 von 6 · Bereitstellung und Verbesserung · ~ 2 Stunden

Sie haben einen geschulten Kontrollpunkt. Jetzt setzen Sie ihn gleichzeitig auf beiden Armen ein, bewerten Sie ihn streng mit einem zweibrochigen Protokoll und verstehen Sie die Fehlermodi, die für die Koordinierung der beiden Arme einzigartig sind, damit Sie sich systematisch verbessern können.

Einheitliche Einrichtung für zwei Arme

Bimanuelle Ableitung führt ein einziges Richtliniennetzwerk durch, das gleichzeitig Aktionen für beide Arme ausführt. Die Beobachtungs-Aktionsschleife läuft bei 50Hz die gleiche Frequenz wie Ihre Trainingsdaten mit beiden Nachfolgerschlägen, die ihre jeweiligen Aktionsstücke synchron ausführen.

Quelle ~/dk1-env/bin/activate # Halten Sie Ihre Hand in der Nähe der E-Stop für die ersten 3 Evaluierungsprozesse python -m lerobot.scripts.eval \ --politics-checkpoint ~/dk1-policies/cube-handoff-v1/checkpoint_XXXXX \ --robot-path ~/dk1-config.yaml \ --robot-type dk1_bimanual \ --device cuda \ --num-eval-episodes 10 \ --record-video \ --output-dir ~/dk1-evals/v1 # Ersetzen Sie XXXXX mit Ihrem besten Checkpoint (aus der Verlustkurve der Einheit 5) # --record-video speichert beide Armansichten als separate mp4 Dateien für Fehleranalyse

Bei der ersten Bewertung darf die Politik ohne Unterbrechung ausgeführt werden, es sei denn, eine physische Kollision ist unmittelbar bevorsteht. Beachten Sie, ob die Politik konsequent die gleichen Phasen der Aufgabe erreicht (Anschließung, Ergreifen, Übertragung, Ort, Wohnort) auch wenn sie letztlich versagt.

Bimanuale Bewertungsprozedur

Die informelle Bewertung "es scheint zu funktionieren" ist für zweimannuale Richtlinien unzuverlässig, da teilweise Erfolge viel häufiger sind und eine grundsätzlich gebrochene Übergabe maskieren können.

Protocol Item Bimanual Specification
Number of episodes 10 minimum; 20 for high-confidence results before adding more data
Cube starting position Fixed, tape-marked position — same as your Unit 4 training setup
Lighting Must match training conditions. Even opening a window can shift lighting enough to affect the workspace camera
What counts as full success Cube starts on right side, ends on left side, both arms return to home pose, no human contact during episode
What counts as partial success Correct grasp achieved but transfer fails, or transfer succeeds but placement is off-target. Log these separately.
Failure classification Log: (A) grasp failure, (B) handoff failure — arm-to-arm transfer drops, (C) placement failure, (D) timeout. The handoff failure category (B) is unique to bimanual and most informative for improvement.
Report metric Full success rate (episodes with all 4 phases correct). Also report partial success rate. Example: "4/10 full, 7/10 reached handoff phase".

Häufige Bimanuale-Fehlermodus

Diese Ausfallmodi unterscheiden sich von Einarms-Ausfällen und erfordern zweimal spezifische Reparaturen:

  • Arme kommen asynchron zum Handoverpunkt: Ein Arm erreicht die Handoverposition und wartet; der andere kommt spät an. Die Politik hat das relative Timing zwischen den Armen nicht gelernt. Fix: Fügen Sie 20 Demonstrationen hinzu, in denen beide Arme vor Abschluss der Übertragung explizit 12 Sekunden am Handoverpunkt pausieren. Dies macht die Synchronisierungsanforderung in den Daten explizit.
  • Übergabe Drop Cube fällt zwischen den beiden Armen: Das häufigste zweimannige spezifische Ausfall. Der empfangende Arm schließt seinen Griff zu früh oder zu spät im Vergleich zum Freisetzungsarm.
  • Politik konvergiert auf eine Einarmsstrategie: Die Politik lernt, die Aufgabe mit nur einem Arm zu erledigen, ohne die Fähigkeiten des anderen Arms zu ignorieren. Dies geschieht, wenn die Demonstrationen eines Arms konsistenter sind als die des anderen.
  • Kollision zwischen den Armen: Beide Arme versuchen, den gleichen Arbeitsplatz zu besetzen. Dies ist ein Sicherheitsereignis ermöglichen die Kollisionsvermeidung im DK1-Hardware-Server (T0 in dk1-config.yaml) während der Bewertung.
  • Phasen-Desynchronisierung bei der Bereitstellung: Die Politik führt die richtigen Aktionen aus, aber nicht in der richtigen zeitlichen Reihenfolge z.B. Rechte-Arm-Platzplätze, bevor der linke Arm übertragen wurde. Dies ist ein Aktions-Chunking-Artefact, bei dem die Schnittgrenzen nicht mit den Übergangsphasen der Aufgabe übereinstimmen.

Das Daten-Flugrad für die Bimanuale Verbesserung

Die gleiche Verbesserungsschleife, die für Einarms-Politiken funktioniert, funktioniert für bimanual mit einer bimanual-spezifischen Ergänzung: Zielen Sie immer auf den first-Fehlermodus in der Aufgabensequenz. Die Übergabe (Phase B) kann nicht verbessert werden, wenn die Grip (Phase A) immer noch inkonsistent ist. Beheben Sie Fehler in der Aufgabensequenzfolge.

1

Beurteilung

10 Episoden ausführen. Klassifizieren Sie jeden Ausfall nach Phasen (A/B/C/D)

2 .

Ziel

Identifizieren Sie die erste Fehlerphase. Sammeln Sie 20 30 Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-Demo-

3

- Weiterbildung

Fügen Sie gezielte Demo-Daten zu dem Datensatz hinzu.

4

Beurteilung

  • Haben sich die Erfolgsraten verbessert?

Was kommt als Nächstes?

Sie haben jetzt eine arbeitende zweibrochige Lernpipeline. Die Kubusübergabe ist die Grundlage die gleiche Architekturskala für deutlich komplexere Aufgaben:

  • Ich weiß .

Fernbedienung mit variabler Geschwindigkeit

Geschwindigkeitsadaptive Teleoperation für kontaktreiche Aufgaben, bei denen Kraftfeedback die optimale Bewegungsgeschwindigkeit verändert.

](T2) [

Fügen Sie anstarkere Hände hinzu

Kombinieren Sie die DK1-Arme mit der Orca Hand, um auf der Fingerhöhe geschickt zu sein bei Aufgaben, die eine präzise Handmanipulation erfordern.

](T3) [

Skalieren Sie Ihren Datensatz

Techniken zur Skalierung der bi-manuellen Datenerfassung über Operatoren, Aufgaben und Hardware-Konfigurationen hinweg.

](T4)

Teilen Sie Ihre Ergebnisse mit

Die Ergebnisse der Bima-Resequenz gehören zu den wertvollsten, die die Community sammelt.

](T5)

Einheit 6 vollendet, wenn...

Ihr DK1 vollendet die Aufgabe der Kubusübergabe autonom mit einer vollständigen Erfolgsrate von mindestens 6/10 in einem strukturierten Bewertungslauf. Sie haben alle Fehlerfälle nach Phasen (A/B/C/D) klassifiziert und identifiziert, welche Phase für die meisten Fehler verantwortlich ist. Sie haben die Fehlervideos gesehen und können genau artikulieren, was schief gelaufen ist. Sie verstehen das zweimanschließende Datenruder gut genug, um Ihre nächste Verbesserungs-Iteration zu planen.

Sie haben ein funktionierendes, bi-manuale Roboternetzwerk gebaut.

Sie haben eine Führungskräfte- und Nachfolgerarchitektur konfiguriert, synchronisierte Demonstrationen mit zwei Armen gesammelt, eine koordinierte Politik von Grund auf ausgebildet und auf echter Hardware eingesetzt. Bimanuale Manipulation auf dieser Ebene ist der Ort, an dem Forschungslabors arbeiten. Das Fundament, das Sie hier aufgebaut haben, schafft die Montage, Kochen und Kontakt-reichen Aufgaben, die vor dem Beginn dieses Weges außer Reichweite waren.

[← Zurück zu Wegübersicht]