Zurück zu Research

Messung der Datenqualität der Roboterdemonstration: Schlüsselmetriken und Schwellenwerte

Wie die Qualität von Roboterteleoperationsdemonstrationen vor dem Training zu bewerten ist <unk> Erfolgsrate, Glattigkeit, Abdeckung und Vielfalt.

[← Forschung]

Datenqualitätsmesswerte, die die politische Leistung und die Schwellenwerte vor der vollständigen Ausbildungsführung vorhersagen.

Qualität über Quantität

Die wichtigste Erkenntnis aus der großen Umfangs-Imitierung-Lernforschung in den letzten drei Jahren ist, dass die Datenqualität die Datenmenge für die Politikleistung bis zu etwa 10.000 Demonstrationen dominiert.

Trotz dieser Tatsache haben die meisten Daten-Sammlungsprogramme keine formellen Qualitätsmesswerte.

Erfolgsrate der Aufgabe

Die Erfolgsrate ist die wichtigste einzelne Messung. Sie misst, welcher Bruchteil der Demonstrationen in Ihrem Datensatz eine wirklich erfolgreiche Aufgabe abschließt, nicht nur eine abgeschlossene Bewegung.

  • ** Binärer Erfolg:** Der Goldstandard ein menschlicher Rezensionär schaut jede Episode und etikettiert sie durch/versagt gegen eine schriftliche Rubrik.
  • Teilkredit-Rubriche: Bei komplexen mehrstufigen Aufgaben verliert ein binäres Etikett Informationen. Eine 5-Punkte-Rubrike (0: vollständiger Fehler, 1: Aufgabe begonnen, 2: Schlüssel-Intermedium erreicht, 3: fast vollständig, 4: vollständiger Erfolg) ermöglicht die korrelle Kuration von Datensätzen.
  • Automatische Erfolgsklassifizierer: Für die Skala trainieren Sie einen ResNet-18- oder CLIP-basierten Classifier auf einem manuell gekennzeichneten Samensatz von 5001,000 Episoden. Anwendet sie auf alle verbleibenden Episoden. Erreicht 8592% Genauigkeit für gut definierte Aufgaben. Validieren Sie immer die Leistung des Classifiers gegenüber einem frisch gehaltenen, von Menschen gekennzeichneten Set.

Streckengleichheit

Durch schlaffe Demonstrationen werden bessere Politiken ausgebildet. Durch schlaffe Demonstrationen, die durch die Unerfahrung des Betreibers, die Teleoperationsverzögerung oder mechanische Bindung verursacht werden, wird ein hoher Frequenzgeräusch eingeführt, von dem die Politik nicht lernen kann und den sie im Einsatz wiederholen kann.

  • Jerk-Metrik: Die dritte Position-Derivat bezüglich der Zeit. Berechnen Sie den RMS-Jerk über jede Bahn. Gute Operator-Demos haben RMS-Jerk < 2 m/s3 für die Manipulation von Tischplatten. Flagge-Episoden mit RMS-Jerk > 5 m/s3 für menschliche Überprüfung.
  • ** Geschwindigkeitsvarianz:** Hohe Varianz in der End-Effektorgeschwindigkeit (gemessen als Coefficient der Variation von
  • Gebundene Geschwindigkeitsgrenzen: Ablehnen Sie Episoden, in denen eine Verbindung 80% ihrer maximalen Nenngeschwindigkeit überschreitet.

Arbeitsplatzbestimmung

Eine Politik, die nur auf Demonstrationen ausgerichtet ist, die alle den gleichen Weg folgen, wird scheitern, wenn sich die anfänglichen Bedingungen leicht unterscheiden.

  • Kommunierungsvolumen des Endeeffektors: Berechnen Sie den 3D-Kommunierungsvolumen aller Positionen des Endeeffektors im gesamten Datensatz. Vergleichen Sie mit dem theoretischen Aufgabenbereich. Ziel >60% Abdeckung für Aufgaben mit hoher Anfangszustandvarianz.
  • Objektpositiondeckung: Wenn die Objektplatzierung während der Sammlung randomisiert wird, überprüfen Sie, ob die Verteilung der Objektsstartpositionen in Ihrem Datensatz über den vorgesehenen Bereich gleich ist.
  • Verteilung der Streckenlänge: Zeichnen Sie das Histogramm der Streckenlänge pro Episode (in Schritten). Die Verteilung sollte einmodal und nicht zu breit sein (CV < 0,4). Eine bimodal verteilung zeigt oft zwei verschiedene Lösungsstrategien an die ausdrücklich zu behandeln sind.

Maßnahmen Vielfalt

Die Maßnahmenvielfalt misst, ob Ihr Datensatz eine reiche Vielfalt an Manipulationsstrategien enthält, was für Schulungspolitik wichtig ist, die unerwartete Zustände bewältigen kann.

  • Aktionsentropie: Beschränken Sie den Aktionsraum und berechnen Sie die Entropie der Aktionsgrenzverteilung.
  • Diversität pro Betreiber: Berechnen Sie eine paare DTW-Distanzmatrix zwischen allen Trajektorienpaaren des gleichen Betreibers gegenüber verschiedenen Betreibern.
  • Grasp-Pose-Vielfalt: Für die Grappingaufgaben extrahieren Sie die Greifer-Orientierung beim Griffkontakt für jede Demo. Zeichnen Sie die Verteilung über die SO(3)-Sphäre. Ein guter Datensatz umfasst eine Reihe von Annäherungswinkeln, nicht nur einen einzigen kanonischen Top-Down-Grip.

Die menschliche Konsistenz-Score

Diese Metrik misst, wie reproduzierbar die Demonstrationen zwischen den Betreibern sind eine Proxy für die Klarheit und Erreichbarkeit der Aufgabenbeschreibung.

  • Inter-Operator-Abkommen: Berechnen Sie die Erfolgsrate für jeden Operator separat. Die Variation zwischen den Operatoren (σ2 der Erfolgsraten pro Operator) sollte gering sein.
  • Goldstandardähnlichkeit: Vergleichen Sie die Demonstrationen jedes Betreibers mit dem Goldstandard, der mit DTW auf gemeinsamen Bahnen festgelegt wurde.

Automatisierte Qualitätspipelinearchitektur

Die empfohlene Pipeline führt jede Einnahme-Episode durch vier aufeinanderfolgende Toren:

  • Tor 1 Schema und Sensorvalidierung: Überprüft das HDF5-Schema, überprüft, ob die Kamerarahmen nicht leer sind, validiert den Propriozeption-Datenbereich.
  • Tor 2 Kinematische Filter: Gelenkgrenzkontrollen, Geschwindigkeitsgrenzkontrollen, Dauergrenzkontrollen.
  • Tor 3 Glatte Filter: RMS-Sprung und Geschwindigkeitsvarianztürme.
  • Tasche 4 Erfolgsklassifizierer: ML-basierte Erfolgsvorhersage. Zur Ablehnung von ~1525% für typische Aufgaben. Alle Episoden, die durch den Klassifizierer markiert werden, werden anstatt automatisch zu löschen, an die menschliche Überprüfungsschlange gesendet.

Qualitätsschwellen nach Algorithmus

Algorithm Min. Success Rate Max. Jerk (RMS) Min. Demos (typical task) Sensitivity to Noise
Verhaltensklonen >85% <3 m/s³ 500–2,000 High — averages modes
ACT (Action Chunking) >80% <4 m/s³ 200–1,000 Medium — CVAE handles multimodality
Diffusion Policy >70% <5 m/s³ 300–1,500 Low — diffusion models multi-modality
IBC (Implicit BC) >80% <4 m/s³ 1,000–5,000 Medium
GAIL / adversarial IL >75% <5 m/s³ 500–3,000 Low

Diese Schwellenwerte sind konservative Ausgangspunkt. Ihre spezifische Aufgabe, die Roboterplattform und die Umgebung erfordern empirische Kalibrierung.

Die RCSV Datenplattform führt diese Qualitäts-Pipeline automatisch auf allen eingesetzten Episoden durch und stellt für die Überprüfung von Datensätzen pro Metric-Dashboards zur Verfügung.

Qualitätsgarantierte Demonstrationsdaten

Jeder RCSV-Datensatz wird mit einem vollständigen Qualitätsbericht versandt Erfolgsrate, Glattenstandsmesswerte, Abdeckungskarten und Betreiberkonformitätswerte.

Besichtigung der Datendienste →