Die Roboter-Daten-Flugwheel in der Praxis: Eine Fallstudie in der realen Welt
Wie ein Roboter-Daten-Flugrad die Politikleistung <unk> von 500 gestarteten Demo-Demos zu einer kontinuierlich verbesserten Pipeline mit echten Metriken verwandelt.
[← Forschung]
Von 72% auf 93% Erfolgsrate mit 53% weniger Demonstrationen als im Vorfeld
Was ist das Roboter-Daten-Flugrad?
Das Roboter-Daten-Flugrad ist eine zusammengefasste Rückkopplungsschleife: Demonstrationen sammeln, eine Politik ausbilden, einsetzen, die Fehler sammeln, umschulen und wiederholen. Jeder Zyklus erzeugt eine stärkere Politik mit weniger marginalen Bemühungen als der letzte
Die vier Stufen wiederholen sich kontinuierlich: (1) Sammeln
Diese Fallstudie dokumentiert eine echte Pick-and-Place-Aufgabe, die durch fünf Phasen des Flugrads durchgeführt wird. Der Roboter: ein 6-DOF-Arm mit einem parallelen Schlauchgriffer. Die Aufgabe: einen kleinen Schaumblock aus einer festen Position auszuwählen und in einen Behälter in 40 cm Entfernung zu platzieren. Die Platzierung des Objekts variierte innerhalb eines Radius von 10 cm. Alle Daten wurden über [RCSV Teleoperationsinfrastruktur]
Phase 1 Bootstrap: 500 Demos, 72% Basiswert
Wir haben mit 500 teleoperativen Demonstrationen begonnen, die über zwei Tage von drei Betreibern gesammelt wurden.
Bewertungsprotokoll: 100 Versuche mit Objekte, die zufällig innerhalb des zulässigen Radius geprüft wurden. Ein Versuch gilt nur als erfolgreich, wenn der Block vollständig in den Behälter gelegt wird.
| Phase | Total Demos | New Demos Added | Success Rate |
|---|---|---|---|
| Phase 1 — Bootstrap | 500 | 500 | 72% |
| Phase 3 — Failure Retrain | 640 | 140 | 88% |
| Phase 5 — Active Learning Retrain | 940 | 300 | 93% |
Eine Erfolgsrate von 72% bei einer einfachen Pick-and-Place-Tasche klingt niedrig. In der Praxis ist es ein realistischer Ausgangspunkt.
Phase 2 Misserfolg der Bergbau: 140 Episoden, zwei Misserfolgstypen
Nachdem die Phase-1-Politik für eine Woche in der Testumgebung eingesetzt wurde (automatische Einführung, keine menschliche Präsenz), wurden 28% der 500 registrierten Episoden als Fehler durch einen Ergebnisklassifizierter klassifiziert
Von 140 Ausfallepisoden entstanden nach qualitativem Überblick zwei Clusters:
- Near-miss (80 Episoden): Der Roboter hat den Block erfolgreich erfasst und sich dem Müllkorb zuwenden lassen, aber zu früh oder in falscher Winkel freisetzt, wodurch der Block ausprallt.
- ** Vollständig verpasst (60 Episoden):** Der Roboter konnte die Fingerplatzierung nicht verstehen
Der Fingerplatzierungsbereich war um 3 5 mm außerhalb der Mitte, typischerweise wenn der Block am Ende des zulässigen Radius platziert wurde.
Die Betreiber überprüften die 140 Fehler-Episoden über die RCSV-Human Review-Quee. Für jeden Fehler beobachtete ein Betreiber die fehlgeschlagenen Episode und nahm dann eine korrigierende Demonstration auf, die von der gleichen ursprünglichen Objektposition ausging.
Phase 3 Umschulung auf Bootstrap + Fehler: 88% Erfolgsrate
Die Neuausbildung auf dem kombinierten 640-Demo-Datensatz (500 Original + 140 Versagen-zielt) drängte die Erfolgsrate auf 88%
Der missverfolgungsorientierte Ansatz war rund 2,9 mal effektiver als die zufällige Sammlung, um die Lücke von 72% auf 88% zu schließen.
Phase 4 Aktives Lernen: Unsicherheits-Flagged Collection
Für Phase 4 haben wir auf eine unsicherheitsbewusste Variante der Politik umgestellt. Die Diffusionspolitik erzeugt implizite Unsicherheit durch Ensembleschweigerung
Über 1.000 automatisierte Einführung, 20% (200 Episoden) wurden als hohe Unsicherheit gekennzeichnet. Die Betreiber überprüften das gekennzeichnete Set und sammelten Korrekturdemonstrationen für 200 weitere Episoden. Das Kriterium des aktiven Lernens gewährleistete, dass diese Demos echte Verteilungslücken deckten
Phase 5 Abschlussreifung: 93% Erfolgsrate
Die Neuausbildung auf allen 940 Demo-Sendungen (500 Bootstrap + 140 Fehlerzielen + 200 aktives Lernen) erzielte eine 93% Erfolgsrate.
Die Infrastruktur, die für den Betrieb des Flugrads erforderlich ist
Das Flugrad ist kein rein ML-Problem
- Deployment Logging: Jede Roboter-Episode muss mit synchronisierten RGB-, proprioception- und Ergebnismetadaten aufgezeichnet werden.
- ** Ergebnisklassifizierer:** Ein schneller, zuverlässiger Classifier, der Episoden automatisch als Erfolg oder Misserfolg bezeichnet.
- Human Review Queue: Eine Benutzeroberfläche für Betreiber, um versagte Episoden zu sehen und korrigierende Demonstrationen aufzuzeichnen. Die Warteschlange muss den Betreiber den Anfangszustand zeigen, aus dem sie die korrigierende Demo starten können.
- Automatische Trainings-Trigger: Wenn sich in der Schlange eine ausreichende Anzahl neuer Demos ansammelt, sollte das Training automatisch starten.
- Modellregister mit Rückführung: Neue Kontrollpunkte müssen vor der Vermarktung verglichen und verglichen werden.
Schlüsselmetriken: Die Demo-Effizienzkurve
In diesem Aufgabentyp folgt die empirische Beziehung zwischen demos insgesamt und der Erfolgsrate einer logarithmischen Kurve. Das "Knie" der Kurve
Das Flugrad verändert die Form dieser Kurve nicht, sondern stellt sicher, dass Sie immer am steilen Teil der Kurve arbeiten, indem Sie direkt auf Fehlermodi abzielen, anstatt neue Daten mit redundanten einfachen Demonstrationen zu verdünnen.
ROI-Vergleich: Flywheel vs. Upfront Collection
Um eine 93%-Erfolgsrate durch rein vorläufige Zufalls-Sammlung zu erreichen, deutet unsere Extrapolation aus der Lernkurve darauf hin, dass etwa 2.000 Demo's erforderlich sind. Der Flywheel-Ansatz erreichte 93% mit 940 insgesamt
Bei der Standard-Sammlung von 4
Erfahren Sie, wie RCSV das Daten-Flugrad für Ihre Roboterprogramme über unsere [Daten-Sammlungsdienste]
Start Ihr Daten-Flugwheel
RCSV bietet eine umfassende Daten-Infrastruktur für das Flugrad
[Erforschung der Datendienste]







