Zurück zu Research

Die Roboter-Daten-Flugwheel in der Praxis: Eine Fallstudie in der realen Welt

Wie ein Roboter-Daten-Flugrad die Politikleistung <unk> von 500 gestarteten Demo-Demos zu einer kontinuierlich verbesserten Pipeline mit echten Metriken verwandelt.

[← Forschung]

Von 72% auf 93% Erfolgsrate mit 53% weniger Demonstrationen als im Vorfeld

Was ist das Roboter-Daten-Flugrad?

Das Roboter-Daten-Flugrad ist eine zusammengefasste Rückkopplungsschleife: Demonstrationen sammeln, eine Politik ausbilden, einsetzen, die Fehler sammeln, umschulen und wiederholen. Jeder Zyklus erzeugt eine stärkere Politik mit weniger marginalen Bemühungen als der letzte , weil Sie genau die Fehlermodi anvisieren, die Ihre aktuelle Politik zeigt, nicht zufällig aus allen möglichen Roboterverhalten zu sammeln.

Die vier Stufen wiederholen sich kontinuierlich: (1) Sammeln Sammeln von menschlichen Demonstrationsdaten für die Ziel Aufgabe; (2) Sammeln Schulen oder Feinstellen einer Politik für die gesammelten Daten; (3) Deploy Führen Sie die Politik in einer realen oder halberealen Umgebung aus und protokollieren Sie alle Episoden; (4) Mine Fails Identifizieren Sie, welche Episoden versagt haben, sammeln Sie korrigierende Demonstrationen und kehren Sie zur Ausbildung zurück.

Diese Fallstudie dokumentiert eine echte Pick-and-Place-Aufgabe, die durch fünf Phasen des Flugrads durchgeführt wird. Der Roboter: ein 6-DOF-Arm mit einem parallelen Schlauchgriffer. Die Aufgabe: einen kleinen Schaumblock aus einer festen Position auszuwählen und in einen Behälter in 40 cm Entfernung zu platzieren. Die Platzierung des Objekts variierte innerhalb eines Radius von 10 cm. Alle Daten wurden über [RCSV Teleoperationsinfrastruktur] T1 gesammelt.

Phase 1 Bootstrap: 500 Demos, 72% Basiswert

Wir haben mit 500 teleoperativen Demonstrationen begonnen, die über zwei Tage von drei Betreibern gesammelt wurden.

Bewertungsprotokoll: 100 Versuche mit Objekte, die zufällig innerhalb des zulässigen Radius geprüft wurden. Ein Versuch gilt nur als erfolgreich, wenn der Block vollständig in den Behälter gelegt wird.

Phase Total Demos New Demos Added Success Rate
Phase 1 — Bootstrap 500 500 72%
Phase 3 — Failure Retrain 640 140 88%
Phase 5 — Active Learning Retrain 940 300 93%

Eine Erfolgsrate von 72% bei einer einfachen Pick-and-Place-Tasche klingt niedrig. In der Praxis ist es ein realistischer Ausgangspunkt.

Phase 2 Misserfolg der Bergbau: 140 Episoden, zwei Misserfolgstypen

Nachdem die Phase-1-Politik für eine Woche in der Testumgebung eingesetzt wurde (automatische Einführung, keine menschliche Präsenz), wurden 28% der 500 registrierten Episoden als Fehler durch einen Ergebnisklassifizierter klassifiziert ein kleiner CNN-Trainer, der auf 200 handbezeichnete Frames trainiert wurde, um "Block in bin" vs. "nicht in bin" zu erkennen.

Von 140 Ausfallepisoden entstanden nach qualitativem Überblick zwei Clusters:

  • Near-miss (80 Episoden): Der Roboter hat den Block erfolgreich erfasst und sich dem Müllkorb zuwenden lassen, aber zu früh oder in falscher Winkel freisetzt, wodurch der Block ausprallt.
  • ** Vollständig verpasst (60 Episoden):** Der Roboter konnte die Fingerplatzierung nicht verstehen Der Fingerplatzierungsbereich war um 35 mm außerhalb der Mitte, typischerweise wenn der Block am Ende des zulässigen Radius platziert wurde.

Die Betreiber überprüften die 140 Fehler-Episoden über die RCSV-Human Review-Quee. Für jeden Fehler beobachtete ein Betreiber die fehlgeschlagenen Episode und nahm dann eine korrigierende Demonstration auf, die von der gleichen ursprünglichen Objektposition ausging.

Phase 3 Umschulung auf Bootstrap + Fehler: 88% Erfolgsrate

Die Neuausbildung auf dem kombinierten 640-Demo-Datensatz (500 Original + 140 Versagen-zielt) drängte die Erfolgsrate auf 88% eine 16-Punkte-Verbesserung bei 140 neuen Demos. Zum Vergleich: Wir schätzten, dass die Erreichung von 88% allein von Phase 1 ungefähr 400 zusätzliche zufällig gesammelte Demos auf der Grundlage der beobachteten Lernkurve-Schleunung erfordern würde.

Der missverfolgungsorientierte Ansatz war rund 2,9 mal effektiver als die zufällige Sammlung, um die Lücke von 72% auf 88% zu schließen.

Phase 4 Aktives Lernen: Unsicherheits-Flagged Collection

Für Phase 4 haben wir auf eine unsicherheitsbewusste Variante der Politik umgestellt. Die Diffusionspolitik erzeugt implizite Unsicherheit durch Ensembleschweigerung wir haben ein kleines Ensemble aus drei Lärmvorhersage-Kopfen und markierten Episoden hinzugefügt, bei denen die zwischenköpfige Unvereinbarkeit über die vorhergesagte Aktionsbahn eine Schwelle überschritten hat.

Über 1.000 automatisierte Einführung, 20% (200 Episoden) wurden als hohe Unsicherheit gekennzeichnet. Die Betreiber überprüften das gekennzeichnete Set und sammelten Korrekturdemonstrationen für 200 weitere Episoden. Das Kriterium des aktiven Lernens gewährleistete, dass diese Demos echte Verteilungslücken deckten vor allem ungewöhnliche Objektorientierungen und Arbeitsplatzplazitionen.

Phase 5 Abschlussreifung: 93% Erfolgsrate

Die Neuausbildung auf allen 940 Demo-Sendungen (500 Bootstrap + 140 Fehlerzielen + 200 aktives Lernen) erzielte eine 93% Erfolgsrate.

Die Infrastruktur, die für den Betrieb des Flugrads erforderlich ist

Das Flugrad ist kein rein ML-Problem es ist ein Infrastrukturproblem.

  • Deployment Logging: Jede Roboter-Episode muss mit synchronisierten RGB-, proprioception- und Ergebnismetadaten aufgezeichnet werden.
  • ** Ergebnisklassifizierer:** Ein schneller, zuverlässiger Classifier, der Episoden automatisch als Erfolg oder Misserfolg bezeichnet.
  • Human Review Queue: Eine Benutzeroberfläche für Betreiber, um versagte Episoden zu sehen und korrigierende Demonstrationen aufzuzeichnen. Die Warteschlange muss den Betreiber den Anfangszustand zeigen, aus dem sie die korrigierende Demo starten können.
  • Automatische Trainings-Trigger: Wenn sich in der Schlange eine ausreichende Anzahl neuer Demos ansammelt, sollte das Training automatisch starten.
  • Modellregister mit Rückführung: Neue Kontrollpunkte müssen vor der Vermarktung verglichen und verglichen werden.

Schlüsselmetriken: Die Demo-Effizienzkurve

In diesem Aufgabentyp folgt die empirische Beziehung zwischen demos insgesamt und der Erfolgsrate einer logarithmischen Kurve. Das "Knie" der Kurve , wo die Randrenditen stark fallen erscheint bei einfachen Pick-and-Place rund 600800 Demos. Neben dem Knie erfordert jede zusätzliche Verbesserung von 5% 35x so viele Demos wie die vorherige 5% Verbesserung.

Das Flugrad verändert die Form dieser Kurve nicht, sondern stellt sicher, dass Sie immer am steilen Teil der Kurve arbeiten, indem Sie direkt auf Fehlermodi abzielen, anstatt neue Daten mit redundanten einfachen Demonstrationen zu verdünnen.

ROI-Vergleich: Flywheel vs. Upfront Collection

Um eine 93%-Erfolgsrate durch rein vorläufige Zufalls-Sammlung zu erreichen, deutet unsere Extrapolation aus der Lernkurve darauf hin, dass etwa 2.000 Demo's erforderlich sind. Der Flywheel-Ansatz erreichte 93% mit 940 insgesamt 53% effizienter.

Bei der Standard-Sammlung von 48 USD pro Demonstration (je nach Aufgabenkomplexität) beträgt die Einsparung für eine einzige Aufgabe 4 240 USD 8 480 USD. Für eine Organisation, die 10 verschiedene Roboterverhaltensweisen einsetzt, spart der Flywheel-Ansatz 42 000 USD 85 000 USD in Datenansammlungskosten pro Politiker vor der Berücksichtigung der kontinuierlichen Verbesserung, die der Flywheel nach der Bereitstellung erzeugt.

Erfahren Sie, wie RCSV das Daten-Flugrad für Ihre Roboterprogramme über unsere [Daten-Sammlungsdienste] T3) oder die [Fearless Platform] T4) für selbstverwaltete Datenleitungen implementieren kann.

Start Ihr Daten-Flugwheel

RCSV bietet eine umfassende Daten-Infrastruktur für das Flugrad von der ersten Demonstrationserhebung bis hin zu automatisierten Ausfall-Mining- und Umschulungspipelungen.

[Erforschung der Datendienste]