Zurück zu Blog

Was macht gute Roboter-Trainingsdaten?

Ein praktisches Rahmenwerk für die Qualität von Daten für Roboter-Training: die 6 Dimensionen Vielfalt, Konsistenz, Vollständigkeit, Genauigkeit, Gleichgewicht und Format - plus eine 10-Punkte-Checkliste.

[← Blog]

200 ausgezeichnete Demonstrationen übertreffen immer wieder 2.000 mittelmäßige. Der Unterschied liegt auf sechs messbaren Qualitätsdimensionen, die jedes Team verfolgen sollte.

Das Problem der Abfall-In-Abfall-Out-Roboter-Politik

Das imitierende Lernen ist ein Problem der Verteilung: Die ausgebildete Politik wird die Verteilung von Verhaltensweisen in ihren Trainingsdaten annähernd annähern. Wenn diese Verteilung fehlgeschlagenen Greifungen, unübersichtliche Bewegungen, inkonsistente Strategien und zweideutige Erfolgskriterien beinhaltet, lernt die Politik alle treu zu reproduzieren. Im Gegensatz zu Sprachmodelltraining, bei dem einzelne laute Beispiele durch Milliarden anderer Beispiele ausgleicht werden, sind [Roboter-Demonstrationsdaten]T1) klein genug, dass jede einzelne Episode wichtig ist.

Ein Datensatz von 500 sorgfältig kontrollierten Demonstrationen wird eine bessere Politik erzeugen als ein Datensatz von 5.000 unkontrollierten Demonstrationen. Dies ist keine ambitionierte Behauptung - es ist ein konsistentes empirisches Ergebnis über Forschungsgruppen, Aufgabenarten und Politikarchitekturen hinweg. Die Erklärung ist einfach: Ein sauberer, vielfältiger, konsistenter Datensatz gibt der Politik ein klares Signal darüber, was zu lernen ist. Ein lauter, voreingenommener, inkonsistenter Datensatz gibt der Politik ein verwirrtes Signal, das sie durch Durchschnittswerte über widersprüchliche Verhaltensweisen löst, was eine mittlere Leistung an allem und nicht eine starke Leistung an allem erzeugt.

Im folgenden Rahmen werden sechs Dimensionen identifiziert, die qualitativ hochwertige Roboterdemonstrationsdaten von mittleren Daten unterscheiden.

Dimension 1: Vielfalt

Die Vielfalt ist die wichtigste Qualitätsdimension, weil sie direkt bestimmt, wie gut die Politik verallgemeinert wird. Ein Datensatz muss Variationen über jede Achse umfassen, die zwischen Ausbildung und Einsatz unterschiedlich sein werden: Objektinstantien, Objektpositionen, Lichtbedingungen, Hintergrundunordnung und Betreiberverhalten.

Objektvielfalt: Mindestens 10-20 verschiedene Instanzen jeder Zielobjektkategorie enthalten, die in Größe, Farbe, Material und Marke variieren. Wenn Ihre Aufgabe es um die Abholung von Tassen geht, sammeln Sie Demonstrationen mit Keramikkufen, Papiertassen, Kunststoffreise-Tassen, Glastassen und Metalltassen.

Positionsvielfalt: Verschiedene Objekte in den Startpositionen des voll erreichbaren Arbeitsraums, mit einem Gitter von mindestens 30 x 40 cm. Fügen Sie verschiedene Orientierungen ein - aufrecht, geneigt, 90 Grad gedreht. Wenn die Richtlinie während des Trainings nur Objekte im Zentrum des Arbeitsraums sieht, wird sie während des Einsatzes bei den Rändern versagen.

Diversität der Beleuchtung: Unter mindestens 3 unterschiedlichen Beleuchtungszuständen: warme Oberlichtfluoreszenz, kühles Tageslicht aus Fenstern und gemischte oder richtungsweisende Beleuchtung.

Diversität der Betreiber: Verwenden Sie mindestens 3 verschiedene Betreiber, die jeweils einen ungefähr gleichen Anteil an Demonstrationen tragen. Jeder Betreiber nähert sich der Aufgabe unterschiedlich - unterschiedliche Annäherungswinkel, Fangpunkte, Geschwindigkeiten und Wiederherstellungsstrategien. Diese Vielfalt ist wertvoll, weil sie die Politik dazu zwingt, die Aufgabenstruktur zu lernen, anstatt die Eigenheiten einer einzelnen Person.

Dimension 2: Konsistenz

In der Regel ist die Einheitlichkeit der Aufgaben definiert, die Erfolgskriterien und das Reset-Verfahren in allen Episoden identisch.

Erfolgskriterien müssen binär und eindeutig sein. Für Pick-and-Place-Aufgaben bedeutet Erfolg, dass das Objekt am Ende der Episode innerhalb einer definierten Toleranz am Zielort ist. "Genau genug" ist kein Kriterium. Schreib die Erfolgskriterien in deinem Sammelprotokoll und überprüf, ob alle Betreiber sie auf die gleiche Weise anwenden.

Reset-Verfahren müssen standardisiert werden. Zwischen Episoden müssen Objekte nach einem definierten Randomisierungsprotokoll in neue Startpositionen platziert werden, der Arbeitsplatz von Trümmern oder Verlagerungen aus dem vorherigen Versuch befreit und der Roboter muss zu einer konsistenten Startkonfiguration zurückkehren. Schwachspiel-Reset-Systemen führen systematische Vorurteile ein - Objekte, die sich in der Nähe bestimmter Orte ansammeln, weil die Betreiber sie dort standardmäßig platzieren, Hintergrundunordnung, die sich über Episoden hinweg bewegt.

Die Kalibrierung des Betreibers ist unerlässlich. Bevor die Demonstrationen eines Betreibers auf den Datensatz abzielen, sollten sie eine Kalibrierungssitzung von 2-4 Stunden durchführen, um die Teleoperationsschnittstelle zu lernen, die Erfolgskriterien zu verinnerlichen und konsistente Ansatzstrategien zu entwickeln. Unkalibrierte Betreiber führen Demonstrationen durch, die die politische Leistung aktiv beeinträchtigen.

Dimension 3: Vollständigkeit

Jede Episode muss die gesamte Aufgabe von der ersten Ansatz bis zur letzten Veröffentlichung erfassen, wobei alle Sensorströme synchronisiert sind und keine fehlenden Daten.

** Keine fehlenden Modalitäten.** Wenn Ihre Sammlungseinrichtung zwei Kameras, gemeinsame Encoder und einen Kraft-Torks-Sensor umfasst, muss jede Episode alle vier Streams haben. Eine einzelne Episode mit einem abgelaufenen Kamera-Feed lehrt die Politik, dass die fehlende Kamera manchmal Null ist, was die visuelle Verarbeitung Pipeline verwirrt.

** Synchronisierte Zeitstempel.** Alle Sensorströme müssen innerhalb der Kontrollperiode (typischerweise 5-20 ms) zeitlich ausgerichtet sein. Ungleichgestellte Ströme erzeugen eine inkonsistente Kartierung zwischen dem, was der Roboter sieht und was er tut - die Aktion zur Zeit T wird mit der Beobachtung von der Zeit T minus 50 ms verbunden, was ein systematisch verschobenes Trainingssignal erzeugt. Überprüfen Sie die Synchronisation automatisch, indem Sie die Zeitstempel-Ausrichtung in jeder Episode überprüfen.

** Vollständige Aufnahme von Episoden.** Episoden, die mitten in der Grappe beginnen (weil die Aufnahme spät ausgelöst wurde) oder vor der Erledigung der Aufgabe enden (weil die Aufnahme frühzeitig gestoppt wurde), sind für die meisten Politik-Trainings-Pipelines nicht nutzbar. Konfigureren Sie Ihr Sammelsystem, um die Aufnahme zu beginnen, bevor die Aufgabe beginnt, und stoppen Sie, nachdem der Roboter zu seiner Anfangskonfiguration zurückkehrt.

Dimension 4: Genauigkeit

Genauigkeit umfasst die Richtigkeit der Demonstrationen selbst und der ihnen beigefügten Metadaten.

Demonstrationsgenauigkeit: Nur voll erfolgreiche Episoden sollten in das Trainingssatz für Imitationslernen aufgenommen werden. Der Mechanismus ist klar: Die Politik lernt, dass "fast greifen" oder "halbweg fallen" ein akzeptabler Endzustand ist.

** Streckenqualität:** Demonstrationen sollten reibungslos, bewusst und effizient sein. Messen Sie die Glattigkeit mit der Jark-Methrik (Dritte Ableitung von gemeinsamen Positionen), erstellen Sie Basislinien pro Aufgabe von Ihren besten Betreibern und filtern Sie Demonstrationen unter 70% dieser Basislinie.

Annotationsgenauigkeit: Erfolgs-/Fehler-Labels, Sprachanweisungslabels, Aufgabenphasensegmentierung und Objektidentitäts-Tags müssen korrekt sein. Fehle Annotationen beschädigen das Trainingssignal. Sprachanweisungen sollten gegen das tatsächliche Aufgabenverhalten überprüft werden ("Pick up the red cup" sollte nicht auf einer Episode, in der der Betreiber eine blaue Schüssel abgeholt hat, gekennzeichnet werden). Automatisierte Validierungswerkzeuge sollten Fehl Übereinstimmungen zwischen Anmerkungen und Beobachtungen aufzeigen.

Dimension 5: Gleichgewicht

Eine ausgewogene Datensammlung hat eine ungefähr gleiche Repräsentation zwischen den Bedingungen.

Objektbilanz: Wenn Sie 15 Objektinstanzen haben, aber 60% der Demonstrationen 3 davon verwenden, lernt die Politik diese 3 Objekte gut und die anderen 12 schlecht.

Positionsgleichgewicht: Wenn die meisten Demonstrationen mit Objekten in der Mitte des Arbeitsraums beginnen, wird die Politik an den Arbeitsraumsrandern schwach sein.

Schwierigkeitsbilanz: Ungefähr 10 bis 15% der Demonstrationen sollten bewusst herausfordernde Szenarien umfassen: Objekte am Rande der erreichbaren Reichweite, unordentliche Arbeitsräume, ungewöhnliche Ausrichtung, Nahezu-Fehler-Erholungen. Eine unterrepräsentierte Ausführung von Edge-Falls ist eine der häufigsten Ursachen für unerwartete Einsatzfehler.

Abmessung 6: Format

Das Datenformat bestimmt, wie leicht sich der Datensatz mit den Trainingsleitungen integriert, wie effizient er gespeichert und übertragen werden kann und ob er mit den Gemeinschaftsstandards vereinbar ist.

Verwenden Sie etablierte Formate. HDF5 oder Zarr für die Speicherung von Rohepisoden. Das LeRobot HuggingFace Format für die gemeinsame Nutzung und die Kompatibilität mit der Community. Öffnen Sie das X-Embodiment-Schema für die Forschung über die verschiedenen Körper.

Inklusive vollständiger Metadaten. Jede Episode sollte folgende Angaben enthalten: Aufgabenbeschreibung, Erfolg/Niederlage-Label, Sprachanweisung, Roboterplattform-Identifizierer, Kamera-Ein- und Extrinsic, Datumsammlung, Betreiber-Identifizierer und alle unterschiedlichen Umgebungsbedingungen (Lichtverordnung, Tabellenoberfläche, Objektinstance-ID). Diese Metadaten ermöglichen Filterung, Schichtanalyse und gezielte Umschulung unter bestimmten Bedingungen.

Validation des Formates automatisch. Laufen Sie Schemavalidierung auf jeder Episode zum Zeitpunkt des Schreibens aus. Die Festnahme von Formatfehlern während der Sammlung ist wesentlich billiger als sie während des Trainings zu entdecken, wenn ein Ingenieur Stunden damit verbringt, zu debuggen, warum der Datenauflader in Episode 3.847 abstürzt.

Dimension 7: Ausfall

Diese Dimension ist kontraintuitiv: gute Datensätze enthalten einen kontrollierten Anteil an Fehlerdemonstrationen. Während Dimension 4 (Genauigkeit) Fehler aus dem Primärschulungssatz ausschließen muss, dient ein separater Satz von markierten Fehlerdemonstrationen kritischen Funktionen für eine robuste Politikschulung.

** Warum Fehlfälle wichtig sind.** Eine Politik, die ausschließlich auf erfolgreiche Demonstrationen ausgerichtet ist, hat keine Darstellung, wie ein Fehlgang aussieht. Die Einbeziehung von 5-10% gekennzeichneten Fehlerdemonstrationen (klares als Fehler im Metadatenbestand gekennzeichnet) ermöglicht mehrere Trainingstechniken:

  • Kontrastatives Lernen: Die Politik zu schulen, um erfolgreiche und fehlerhafte Träger zu unterscheiden, wodurch eine robustere Entscheidungsgrenze geschaffen wird.
  • Erholungsverhaltenlern: Einbeziehen Sie Demonstrationen, bei denen der Betreiber einen Nahezu-Fehler-Zustand (gefallenes Objekt, fehlender Griff) aufweist und sich wiederherstellt. Diese "Erholungsdemonstrationen" lehren der Politik, was zu tun ist, wenn etwas schief geht, anstatt nur zu tun, was zu tun ist, wenn etwas richtig geht.
  • Fehlerkennung: Ein separater Klassifikator, der auf Erfolg/Fehlerdaten ausgerichtet ist, kann als Laufzeitmonitor dienen, der menschliche Interventionen auslöst, wenn die Politik in einen fehlerhaften Zustand gelangt.

Wie können Sie Fehlerdaten sammeln. Versäumten Sie nicht absichtlich die Demonstrationen, sondern bewahren Sie die natürlichen Fehler, die während der Sammlung auftreten (je jeder Betreiber hat eine Fehlerrate von 10 bis 30%, besonders früh in einer Sitzung) und werfen Sie sie nicht weg. Sie werden mit Fehlermodus-Etiketten gekennzeichnet: "verfehltes Greifen", "belassen während des Transports", "unrichtige Platzierung", "Kollision mit Hindernissen". Diese Kennzeichnung ermöglicht eine gezielte Analyse der politischen Schwächen und orientiert die Prioritäten der Wiederaufnahme.

Rekommended ratio: 85-90% erfolgreiche Demonstrationen im Primärschulsystem, 5-10% Wiederherstellung Demonstrationen (nahe Versagen mit erfolgreicher Wiederherstellung) und 5% reine Versagen Demonstrationen (ohne Zweifel erfolgreiche Ergebnisse). Die Wiederherstellungsergebnisse sind die wertvollsten pro Episode, weil sie die Politik lehren, die Verteilung der Staaten zu verwalten, die sie am ehesten begegnen wird, wenn die Dinge schief gehen.

Rubrik für die Bewertung der Datenqualität

Dimension Score 1 (Poor) Score 3 (Adequate) Score 5 (Excellent)
Diversity 1-2 objects, 1 lighting, 1 operator 5-10 objects, 2 lightings, 2 operators 15+ objects, 3+ lightings, 3+ operators
Consistency No written criteria, ad-hoc resets Written criteria, manual reset verification Written criteria, automated reset verification, operator calibration
Completeness Missing modalities in >5% of episodes All modalities present, sync within 50ms All modalities present, sync within 10ms, auto-validated
Accuracy No filtering; includes failed demos Binary success filter, basic smoothness check Automated success classifier, jerk filtering, annotation validation
Balance >5:1 ratio between most/least represented 3:1 max ratio, basic spatial coverage 2:1 max ratio, grid-based coverage, 10-15% edge cases
Format Custom format, missing metadata HDF5/Zarr, basic metadata LeRobot/RLDS compatible, full metadata, auto-validated at write
Failure Inclusion All failures discarded Failures preserved but unlabeled Labeled failures + recovery demos at 5-10% ratio

Eine Datenmenge mit einem durchschnittlichen Punkt von 4+ in allen sieben Dimensionen ist Produktionsqualität. Eine Punktzahl von 3 in jeder Dimension sollte vor der Erhöhung der Sammlung angesprochen werden. Eine Punktzahl von 1-2 in jeder Dimension wird die Politikbildung aktiv schädigen - beheben Sie sie, bevor Sie mehr Daten sammeln.

Gemeinsame Anti-Pattern in der Roboter-Daten-Sammlung

Dies sind die Fehler, die RCSV am häufigsten in Datenmengen sieht, die für die politische Ausbildung eingereicht werden.

  • Die "Graduate-Student-Special". Ein Betreiber, ein Lichtzustand, Objekte immer in der gleichen Ausgangsposition, Daten, die über einen Nachmittag gesammelt wurden.
  • Die "Quantity over quality"-Fasze. 5.000 Demonstrationen wurden so schnell wie möglich ohne qualitativ hochwertige Filterung gesammelt. 30% sind fehlgeschlagen, 20% haben schwierige Wege von müden Betreibern, 10% haben Probleme mit der Zeitstempel-Synchronisierung.
  • ** Der Fehler der "Demo-Haccable-Anlage".** 2000 Demonstrationen zu sammeln, bevor eine einzige Politik ausgebildet wird. Dann zu entdecken, dass die Daten ein systematisches Problem (falscher Kamerawinkel, fehlende Modalität, inkonsistente Erfolgskriterien) haben, das die Wiedererhebung des gesamten Datensatzes erfordert.
  • Die "einfache" Voreingenommenheit. Die Betreiber ziehen sich natürlich zu einfachen Startpositionen und Objektoorientierungen, weil sie schneller und glatter Demonstrationen erstellen. Der Datensatz wird in einfachen Bedingungen überrepräsentiert und in den Randfällen, denen die Politik bei der Bereitstellung begegnet, unterrepräsentiert.
  • ** Das Problem mit dem "Stille Ausfall".* Die Datenerfassung läuft wochenlang fort, aber die Kalibrierung der Kamera flog am 3. Tag ab, und niemand bemerkte es, weil es keine automatisierte Qualitätsüberwachung gab. Alle Daten nach dem 3. Tag haben systematisch falsche extrinsiche Transformationen.
  • Die "Formatumwandlung Alptraum. " Daten in einem benutzerdefinierten Format gesammelt, dann in HDF5 für das Training umgewandelt. Das Conversion-Skript hat einen subtilen Fehler, der alle zehn Zeitschritte fallen lässt. Die Richtlinie trainiert auf beschädigte Daten und versagt bei der Bereitstellung. Beheben: verwenden Sie von Anfang an etablierte Formate und validieren Sie das Schema für jede Episode.

Einzelheiten über die Pipeline zur Qualitätssicherung des RCSV

Die RCSV QA Pipeline läuft bei jeder Episode zur Sammlung - nicht als Batch-Post-Prozess-Schritt. Das bedeutet, dass Qualitätsprobleme innerhalb von Sekunden nach dem Abschluss der Demonstration erfasst werden, was sofortiges Feedback und Wiedererhebung der Betreiber ermöglicht.

Pipeline-Phasen:

  1. Schema Validierung (0.1s). Überprüft, ob alle erforderlichen Datenströme vorhanden sind, die Datentypen korrekt sind und die Episodenmetadaten vollständig sind. Wirf sofort ab, wenn ein Strom fehlt.
  2. Zeitmarken-Synchronisierungskontrolle (0,2 s). Berechnet die Paarezeitmarken-Ausrichtung zwischen allen Sensorströmen. Zurückgewiesen, wenn ein Strom mehr als 10 ms (konfigurbar pro Aufgabe) falsch ausgerichtet ist.
  3. Erfolgsklassifizierung (0,5 s). Ein gelernter Klassifizierer (auf vorher gekennzeichneten Episoden derselben Aufgabe ausgebildet) prognostiziert Erfolg/Niederlage.
  4. Strahlschlauchscoring (0,3 s). Berechnet die Jark-Metrik (Dritte Derivative der gemeinsamen Positionen) und vergleicht sie mit den bei der Kalibrierung des Betreibers erarbeiteten Basislinien pro Aufgabe. Episoden unter dem 70. Perzentil werden markiert.
  5. **Das Programm ist in der Lage, die Daten zu überwachen, um die Daten zu verändern und zu verändern. **Das Programm ist in der Lage, die Daten zu verändern. **Das Programm ist in der Lage, die Daten zu verändern. **Das Programm ist in der Lage, die Daten zu verändern.
  6. Kontrolle der Vollständigkeit der Metadaten (0,1 s). Überprüft, dass alle erforderlichen Anmerkungenfelder ausgefüllt sind: Aufgabenbeschreibung, Sprachanweisung, Operator-ID, Umgebungsbedingungen.

Die Gesamt-QA-Latenz: weniger als 2 Sekunden pro Episode. Der Betreiber sieht einen grünen/gelben/roten Indikator unmittelbar nach Abschluss jeder Demonstration, wodurch in Echtzeit ein Qualitätsfeedback möglich ist, ohne den Sammelfluss zu unterbrechen.

Die 10-Punkte-Checkliste zur Datenqualität

  1. Mindestens 10 unterschiedliche Objektinstanzen pro Zielkategorie
  2. Mindestens 3 Lichtbedingungen
  3. Mindestens drei Betreiber mit ungefähr gleichen Episoden
  4. Schriftliche Erfolgskriterien, die konsequent in allen Episoden angewendet werden
  5. Dokumentation und Einhaltung eines standardisierten Reset-Protokolls
  6. Alle Sensorströme sind in jeder Episode vorhanden und synchronisiert
  7. Vollständige Episode-Fassung vom Anschluss bis zum Abschluss
  8. Binäre Erfolgsklassifizierung mit menschlicher Überprüfung von Grenzfällen
  9. Streckengleichheit mit einer Filterung gegen die Basislinien pro Aufgabe
  10. Daten in einem festgelegten Format (HDF5/Zarr/LeRobot) mit vollständigen Metadaten

Wenn Ihr Datensatz alle 10 Punkte überschreitet, sind es Produktionsqualitätsdaten, die für die Ausbildung zuverlässiger Politik geeignet sind. Wenn es in irgendeinem Punkt fehlschlägt, beheben Sie diese Dimension, bevor Sie mehr Daten sammeln - mehr Daten mit demselben Qualitätsproblem produzieren nur mehr desselben Problems.

Wie RCSV Qualität bei der verwalteten Sammlung gewährleistet

Alle über [RCSV-Datendienste] erhobenen Demonstrationsdaten (T4) gehen durch eine automatisierte Qualitätsleitung, die alle oben beschriebenen Dimensionen durchsetzt. Die Pipeline umfasst: automatisierte Erfolgsklassifizierung mit erlernten Klassifizierern, Glattschuss-Scoring mit operator-spezifischen Baselines, Abdeckungsanalyse im visuellen Einbeziehungsraum zur Überprüfung der Objekt- und Umweltvielfalt, Timestamp-Synchronisierungserprüfung, Schemavalidierung für jede Episode und menschliche Überprüfung für alle Grenzfälle.

Sie erhalten qualitativ zertifizierte Daten mit Qualitätsscores pro Episode, Aggregate-Dekorationsstatistiken, die die Vielfalt auf allen Achsen zeigen, und einen Qualitätsbericht, der dokumentiert, wie das Datensatz in jeder der sechs Dimensionen funktioniert. Diese Zertifizierung bedeutet, dass Sie mit Vertrauen trainieren können, dass Ihre Daten den Standard erfüllen - anstatt Qualitätsprobleme drei Wochen in einem Training zu entdecken.

Für Teams, die ihre eigene Sammelinfrastruktur errichten, bietet das RCSV auch Qualitätsprüfungen für externen Datensätze an. Wir wenden dieselbe Qualitätsleitung auf Ihre Daten an und stellen einen detaillierten Bericht vor, in dem er feststellt, welche Dimensionen verbessert werden müssen.

Verwandte Lesungen

  • Roboter-Datenerhebungskosten -- Haushaltsplanung für die Erhebung von Daten nach Qualität
  • [OpenArm Setup Guide]T7) -- Einrichten der Hardware für Ihre erste Datenerhebungskampagne
  • [LeRobot-Leitfaden] T8) -- Schulungsrichtlinien für Ihre qualitativzertifizierten Datensätze
  • [Null-Shot vs. Few-Shot-Roboter-Politiken] T9) -- Wie die Datenqualität die Effizienz von Fein-Tuning-Effizienz von wenigen Schüssen beeinflusst
  • Roboter Datenschutz und Sicherheit -- Verantwortungsvolle Verarbeitung sensibler Daten während der Erhebung
  • [Zukunft des Roboterdatenmarktes] T11) -- Qualitätsstandards, die den aufstrebenden Datenmarkt prägen
  • RCSV-Datendienstleistungen -- Qualitätszertifizierte Datenerhebung mit automatisierter Qualitätssicherung

Holen Sie sich qualitativ zertifizierte Roboterdemonstrationen

Die Qualitäts-Pipeline des RCSV umfasst alle sechs Dimensionen -- so dass Sie mit Vertrauen trainieren können, dass Ihre Daten den Standard erfüllen.

[Erforschung der Datendienste]