Zurück zu Guides

Roboter-Daten-Sammlung: Vollständiger Leitfaden für ML-Teams

Wie hochwertige Roboter-Trainingdaten gesammelt werden können <unk> Teleoperationsmethoden, Episodeanforderungen, Datenformate und wie man von 50 bis 10.000 Demonstrationen skaliert.

[← Führer]

Das endgültige Spielbuch für die Erhebung von hochwertigen Roboterdemonstrationsdaten von der Auswahl Ihrer Teleoperationsmethode bis zur Skalierung von 50 bis 10.000+ Episoden. Aktualisiert für 2026 mit den neuesten Anforderungen an LeRobot, ACT, Diffusion Policy und VLA-Daten-Feinabstimmung.

Warum echte Roboterdaten Simulationen übertreffen

Die größte Engpässe bei der Einführung von gelernten Roboternmanipulationenpolitik ist nicht die Modellarchitektur es sind Daten. Simulation hat sich mit Tools wie Isaac Sim, MuJoCo und SAPIEN dramatisch verbessert, aber die Sim-zu-Reale Lücke bleibt hartnäckig groß für kontaktreiche Aufgaben.

Die Lücke zwischen Sim und Real schließt sich nicht schnell genug

Gegenstände verformen, schlüpfen und interagieren so, dass selbst die besten Physikmotoren sich schlecht annähern. Ein simuliertes Tuch verhält sich nicht wie ein echtes Baumwolltuch. Eine simulierte Kartonbox schließt sich nicht so wie eine echte unter seitlichem Druck. Beleuchtung, Oberflächentexturen, Kameralarm und Objektivverzerrung in realen Umgebungen erzeugen visuelle Verteilungen, die auch durch neuronale Rendering-Techniken nicht vollständig durch synthetische Rendering repliziert werden können.

Die Zahlen erzählen die Geschichte. Im Jahr 2025 erreichte Google DeepMinds RT-2 62% Erfolg bei der Manipulation neuer Objekte mit 130.000 Real-Welt-Demonstrationen. Die Diffusion Policy des Toyota Research Institute erzielte mit nur 200 Demonstrationen 94% Erfolg bei geschulten Aufgaben, erforderte jedoch, dass diese Demonstrationen hochwertig, konsistent und auf der exakten Hardware-Konfiguration gesammelt wurden.

Wenn man echte Daten braucht

Die Erhebung von Daten aus der realen Welt ist gerechtfertigt, wenn Ihre Aufgabe eines der folgenden Aufgaben beinhaltet:

  • ** Kontaktreiche Manipulation:** Einfügung, Fäden, Montage, Schlepp-in-Grube und jede Aufgabe, bei der Kraftfeedback wichtig ist. Sim-Kontaktmodelle sind für Aufgaben mit Submillimeter-Toleranz nicht genau genug.
  • ** Verformbare Gegenstände:** Stoff, Kabel, Lebensmittel, Taschen. Die verformbare Simulation verbessert sich, produziert aber immer noch qualitativ unterschiedliche Verhaltensweisen als echte Materialien.
  • Visuelle Vielfalt: Aufgaben, bei denen die Richtlinie sich auf reale Lichtbedingungen, Objektetexturen, Hintergründe und Kameraansichten verallgemeinern muss, die die synthetische Rendering nicht vollständig abdecken kann.
  • Hardware-spezifische Bereitstellung: Wenn Ihre Richtlinie auf einem bestimmten Roboterarm mit bestimmten Kameras ausgeführt wird, beseitigt die Sammlung von Daten zu diesem genauen Setup die Ausführungslücke vollständig.
  • ** Mensch-Roboter-Interaktion:** Jede Aufgabe, die Handsendungen, Kooperationsmontage oder einen gemeinsamen Arbeitsplatz mit Menschen beinhaltet.

Die Randomisierung von Domains hat Grenzen

Domänenrandomisierung unterschiedliche Texturen, Beleuchtung, Physikparameter und Kamera-Posen in der Simulation hilft, die Sim-zu-Reale Lücke zu überbrücken, hat aber gut dokumentierte Grenzen. Die Randomisierung visueller Eigenschaften ohne die Übereinstimmung mit realen Verteilungen schafft eine "Realitätshintergrundlücke" wo die Politik erwartet, dass visueller Lärm, der nicht existiert. Für die meisten praktischen Manipulationsaufgaben im Jahr 2026, der effizienteste Weg ist: Kleinschall-Reale Datenerhebung mit einem verwalteten Dienst (wie RCSV) zu validieren, um Ihren Ansatz, dann Skalierung mit Simulationenvergrößerung, wo es hilft.

Die vier Teleoperationsmethoden verglichen

Teleoperation ein menschlicher Betreiber, der einen Roboter fernsteuert, um gewünschte Verhaltensweisen zu demonstrieren ist die dominierende Methode für die Sammlung von Robotern Manipulationsdaten. Die Wahl der Teleoperationsoberfläche beeinflusst die Datenqualität, die Sammelgeschwindigkeit, die Ermüdung des Betreibers und die Kosten direkt. Siehe unseren speziellen [Teleoperationsleitfaden] T3) für tiefere technische Details zu jeder Methode.

Methode 1: Führer-Follower-Arme (ACT / ALOHA-Stil)

Wie funktioniert es: Der Betreiber bewegt einen leichten "Führer" -Arm physisch; ein schwerer "Follower" -Arm repliziert die gemeinsamen Positionen des Führers in Echtzeit über einen direkten USB-Dynamixel-Bus mit einer Latenz von 3-8 ms. Dies ist der Ansatz, den ALOHA, Mobile ALOHA und die meisten Universitätsforschungseinrichtungen im Jahr 2026 verwenden.

** Warum er die besten Daten erzeugt:** Der Betreiber hat proprioceptive Rückmeldungen durch den physischen Führer Arm sie können Widerstand, fast Singularität Steifheit und Tischkontakt fühlen. Dies macht Demonstrationen glattere, konsistentere und natürlicher als jede Bildschirm-basierte Schnittstelle. Mit der Schwergewichtkompensation (Dynamixel-Stromgrenzen bei 30-50% Nennmoment) können Betreiber 2-3 Stunden ohne erhebliche Müdigkeit arbeiten.

** Hardware-Kosten:** $3.000 bis $8.000 für den Führerarm, plus den Anhänger/Produktionsarm.

** Durchsatz:** 20-35 Demonstrationen pro Stunde für Aufgaben der Tischmanipulation. Die schnellste Methode für Kontakt-reiche Aufgaben, da das proprioceptive Feedback versagte Versuche reduziert.

Beste für: ernste Datenerhebungskampagnen, kontaktreiche Manipulationen (Einsetzen, Montage), zweibrochige Aufgaben, jedes Szenario, in dem die Datenqualität die Priorität hat.

Methode 2: VR-Headset (Meta Quest 3)

Wie funktioniert es: Der Betreiber trägt ein VR-Headset und sieht die Kamera-Feed des Roboters oder eine Mixed-Reality-Ansicht.

Latenz: 15-40 ms End-to-End (WiFi + IK-Rechnen + Arm-Kommando).

** Hardware Kosten:** $500 für das Headset. Keine zusätzliche Hardware außerhalb des Roboterarms, Kameras und Rechner.

** Durchsatz:** 15-25 Demonstrationen pro Stunde für die Manipulation auf dem Tisch. Leicht niedriger als der Führer-Follower, da der Betreiber kein proprioceptives Feedback hat und mehr Misserfolgversuche bei Präzisionsarbeiten macht.

Fatigue des Betreibers: VR-Headset verursacht Übelkeit bei einigen Betreibern nach 60-90 Minuten. Planen Sie eine Pause von 15 Minuten pro Stunde. Maximale praktische Sitzung: 3-4 Stunden pro Tag.

Beste für: Teams mit einem Budget, Aufgaben, die keine Submillimeterpräzision erfordern, schnelle Prototypenbildung von Datenverammlungsleitungen, grobe Manipulation (Picking, Placing, Sortierung).

Methode 3: SpaceMouse / Tastatur

** Wie funktioniert es:** Der Betreiber verwendet einen 6-Achsen-SpaceMouse ($ 200) oder ein doppelt analoges Gamepad, um die End-Effektor-Geschwindigkeit oder die Gelenkgeschwindigkeiten zu steuern.

Latenz: 1-5 ms (direkte USB HID). Die niedrigste Latenz aller Methoden, aber die begrenzte Steuerbandbreite kompensiert diesen Vorteil mehr als.

** Durchsatz:** 5-12 Demonstrationen pro Stunde. Die langsamste Methode, da der Betreiber nicht direkt 6-DOF-Posen angeben kann, was zu schweifenden Bahnen und suboptimalen Pfaden führt.

** Datenqualität:** Niedriger als alle anderen Methoden. Die Demonstrationen sind zwischen den Betreibern weniger konsistent, da jeder seine eigene Joystick-Steuerungsstrategie entwickelt.

Beste für: Schnelle Prototypen, wenn keine andere Schnittstelle verfügbar ist, mobile Roboter-Navigationsdaten, Aufgaben, bei denen die Gleitläufigkeit der Armbahn nicht kritisch ist.

Methode 4: Haptikhandschuhe / Exoskelett

** Wie funktioniert es:** Der Betreiber trägt ein Hand-Exoskelett oder haptisches Handschuh (SenseGlove Nova 2 bei $ 8.000/Paar oder HaptX G1 bei $ 20.000/Paar) das die Fingergelenkwinkel verfolgt und sie auf eine geschickte Roboterhand abzeichnet.

** Durchsatz:** 8-15 Demonstrationen pro Stunde. Dexterische Aufgaben sind von Natur aus langsamer, da sie komplexere Sequenzen (Multi-Finger-Griff, Hand-Rotation, Platzierung) beinhalten.

Füchtigkeit des Betreibers: Hohe. Handschuhe sind körperlich anstrengend. 45-minütige Sitzung mit 10-minütigen Pausen. Gesamttägliches Sitzungsgrenz: 4-5 Stunden.

Beste für: Dexteröses Manipulationsforschung, mehrfingerhaftes Greifen, Handdrehung, Werkzeugnutzung, Bekleidungsmanipulation, jede Aufgabe, bei der die Finger-Niveau-Kontrolle unerlässlich ist.

Vergleichstabelle

Method Präzision Operator Learning Curve Setup Cost Demos/Hour Ideal Task Types
Leader-Follower Highest 1-2 hours $15K-$35K 20-35 Contact-rich, insertion, bimanual, assembly
VR / Quest 3 Good 30 min - 1 hour $5K-$12K 15-25 Pick-place, sorting, packing, gross manipulation
SpaceMouse Moderate 2-4 hours $3K-$8K 5-12 Prototyping, navigation, simple manipulation
Haptic Gloves High (dexterous) 3-6 hours $25K-$55K 8-15 Multi-finger grasping, in-hand rotation, tool use

Prinzipien der Episode-Entwurf

Vor der Erhebung einer einzelnen Demonstration müssen Sie definieren, was eine gute Episode darstellt. Schlechte Episode-Design ist die häufigste Quelle für verschwendete Datenerhebung. Hier sind die fünf Designentscheidungen, die bestimmen, ob Ihr Datensatz eine erfolgreiche Politik ausbilden wird.

Aufgabenbeschreibung

Schreiben Sie eine genaue, eindeutige Aufgabenbeschreibung, die ein Betreiber konsequent ausführen kann. "Holt das Objekt hoch". Gut: "Halt den roten Kubus vom linken Schachtel mit einem oben nach unten steckenden Klemmgriff, heben Sie ihn 15 cm über dem Tisch, bewegen Sie sich in die Mitte des rechten Schachtels und lassen Sie ihn los. Der Würfel muss geradeaus in den Müll landen". Je genauer Ihre Aufgabenbeschreibung ist, desto konsistenter sind Ihre Demonstrationen und desto leichter wird Ihre Politik lernen.

Rücksetzungskonformität

Definieert den Anfangszustand der Szene genau. Welche Objekte sind auf dem Tisch? Wo sind sie positioniert? Welcher Zufallsbereich ist akzeptabel? Wie ist der Roboterarm am Anfang jeder Episode positioniert? Ein gut definiertes Reset-Verfahren sollte 15-30 Sekunden zwischen den Episoden dauern. Wenn Ihre Resets länger als 60 Sekunden dauern oder eine zweideutige Platzierung erfordern, verlieren Sie die Durchsatzleistung und führen Sie zu einem Verteilungshäusch, der das Training degradiert.

Erstellen Sie für Tabelle Aufgaben eine Vorlage (gedruckte Papier mit Positionsmarker oder ein Fixtur mit Ausrichtungsanleitungen), mit der die Betreiber die Szene zurücksetzen. Randomizieren Sie die Positionen von Objekten innerhalb eines definierten Grenzfelds (typischerweise 15-25 cm Quadrat) dokumentieren Sie den genauen Randomisierungsbereich.

Beobachtungsraum

Definition genau, was die Politik zur Zeit der Schlussfolgerung beobachten wird, und Aufzeichnung genau diese Signale während der Sammlung.

  • Kamerabilder: 2-4 Ansichten (Overhead, Handgelenk, Seite) bei 480x640 Auflösung, 30 FPS. Verwenden Sie Intel RealSense D405/D455 für RGB-D oder Standard-USB-Kameras für RGB-nur.
  • Gelenkpositionen (qpos): Schwimmen Sie mit 50 Hz an den Gelenkwinkel.
  • Gebundene Geschwindigkeiten (qvel): Flottabteilung von gewundenen Winkelgeschwindigkeiten bei 50 Hz.
  • End-Effektor-Position: Optional 6-DOF (Position + Orientierung) bei 50 Hz. Nützlich für Cartesian-Raumpolitik.
  • Gripperzustand: Binär (offen/geschlossen) oder kontinuierlich (Aperturebreite) bei 50 Hz.

Aufnahme von Signalen, die Sie nicht zur Zeit der Schlussfolgerung verwenden werden, ist nicht erforderlich.

Aktionsraum

Der Aktionsraum definiert, was die Politik voraussagt. Für die meisten Manipulationenpolitik im Jahr 2026 ist die Aktion eine der folgenden:

  • ** Gemeinsame Positionsziele:** Die häufigste Wahl für ACT und Diffusionpolitik.
  • End-Effektor-Geschwindigkeit: verwendet durch einige kartesische Raumpolitik.
  • Absolute End-Effektor-Pose: Weniger verbreitet, wird jedoch von einigen VLA-Modellen verwendet.

** Wichtig:** Die Aktionen werden soweit möglich im gemeinsamen Raum gespeichert. Die meisten modernen Richtlinien (ACT, Diffusion Policy, pi-0) arbeiten im gemeinsamen Raum.

Episodenlänge

Halten Sie die Episoden so kurz wie möglich, während Sie die komplette Aufgabe noch vollziehen.

  • ** Einfache Aufnahme und Einrichtung:** 3-8 Sekunden (150-400 Zeitstufen bei 50 Hz)
  • Mehrstufige Manipulation: 10-25 Sekunden (500-1,250 Zeitschritte)
  • ** Komplexe Montage:** 30-90 Sekunden (1.500-4.500 Zeitstufen)

Lange Episoden (> 60 Sekunden) sind schwieriger zu lernen, da das Problem der Kreditzuweisung exponentiell wächst.

Wie viele Daten benötigen Sie?

Die Anzahl der erforderlichen Demonstrationen hängt von der politischen Architektur, der Komplexität der Aufgaben und der gewünschten Erfolgsrate ab. Hier sind evidenzbasierte Leitlinien aus veröffentlichten Ergebnissen und unserer Erfahrung bei RCSV.

Policy Type Episodes Needed Evidence Notes
ACT (Action Chunking with Transformers) 50 - 200 ALOHA paper: 50 demos for simple tasks, 200 for bimanual Most data-efficient architecture for manipulation. Quality matters more than quantity.
Diffusion Policy 100 - 500 TRI: 200 demos for 94% success on trained tasks Handles multi-modal action distributions well. Benefits from diverse demonstrations.
VLA Feinabstimmung (pi-0, OpenVLA, RT-2) 500 - 2,000 OpenVLA: 1K demos for single-task fine-tuning Pre-trained on large data, but fine-tuning still needs substantial task-specific data.
From-Scratch Stiftungsmodell 5,000 - 100,000+ RT-2: 130K demos. Open X-Embodiment: 2.2M episodes across 22 robots. Only relevant if building a generalist model. Most teams should fine-tune instead.

Die kritische Erkenntnis: 50 hochwertige Demonstrationen werden jedes Mal 500 niedrigwertige Demonstrationen übertreffen. Wenn Sie mit 100 Demonstrationen einer einfachen Aufgabe keinen 70%+-politischen Erfolg erzielen können, ist das Problem Datenqualität oder Pipeline-Bugs, nicht Datenmenge. Beheben Sie diese zuerst, bevor Sie mehr sammeln.

Datensätze

Die Robotergemeinschaft hat sich auf drei primäre Formate konzentriert. Für einen vollständigen technischen Vergleich siehe unseren speziellen [HDF5 vs RLDS vs LeRobot Format Guide]T4).

HDF5 (Hierarchisches Datenformat 5)

HDF5 ist das am häufigsten verwendete Format für Roboterdemonstrationsdaten. Es speichert heterogene Daten (gemeinsame Positionen, Bilder, Metadaten) in einer einzigen Datei mit effizientem zufälligem Zugriff.

Episode-Struktur: Jede Episode ist eine Gruppe, die Datensätze für Beobachtungen, Aktionen und Metadatenattribute enthält.

/episode_0/
    observations/
        images/
            cam_high        # uint8 [T x 480 x 640 x 3]
            cam_wrist_left  # uint8 [T x 480 x 640 x 3]
            cam_wrist_right # uint8 [T x 480 x 640 x 3]
        qpos                # float32 [T x 14]   (7 joints per arm)
        qvel                # float32 [T x 14]
    action                  # float32 [T x 14]   (leader arm positions)
    attrs:
        task = "pick_cube_bimanual"
        operator_id = "op_03"
        success = True
        timestamp = "2026-04-10T14:32:00Z"
        robot_serial = "openarm_007"

Wann HDF5 zu verwenden ist: Als Ihr primäres Sammel- und Speicherformat. Umwandeln Sie nach Bedarf auf andere Formate. HDF5 ist das inspektionsfreundlichste Format, verfügt über reife Python-Tooling (h5py, HDFView) und unterstützt effizienten zufälligen Zugriff auf jeden Rahmen in jeder Episode.

RLDS (Reinforcement Learning Datasets)

Das RLDS-Format von Google verwendet TFRecord-Dateien mit einem standardisierten Schema. Es ist das native Format für Open X-Embodiment (2.2M+ Episoden über 22 Robotertypen) und die Octo Generalist-Politik.

** Stärken:** Standardisiertes Schema ermöglicht das Training zwischen Datensätzen ohne Adapter pro Datensatz. Effizientes Streaming aus Cloud-Speicher über tf.data. Community-Skala: 50+ Datensätze im RLDS-Format verfügbar.

** Schwächen:** Die Abhängigkeit von TensorFlow führt zu einer Spannung für PyTorch-Teams. Sequenzbezugsmuster (keine effiziente Zufalls-Framme-Zugriff).

LeRobot Format (Hugging Face)

Das LeRobot-Format von Hugging Face verwendet Parquet-Dateien für Tabellendaten und MP4-Video für Kamerabeobachtungen.

** Stärken:** Ein-Befehls-Upload zu Hugging Face Hub. Eingebäudes Webvisualisierung. Kompakt MP4-Speicher (5-10-mal kleiner als rohes HDF5). Wachsende Community mit mehr als 300 öffentlichen Datensätzen. Native ACT und Diffusion Policy Training Support.

** Schwächen:** MP4-Codierung ist verlustreich ist nicht geeignet als Quell-of-Truth-Format für kontaktempfindliche Aufgaben. Video-Decodierung fügt Lazzeit während des Trainings hinzu. Neues Format mit sich entwickelnden Werkzeugen.

Unsere Empfehlung: Sammeln und speichern in HDF5. Verwenden Sie T1, um in das LeRobot-Format zum Teilen auf Hugging Face Hub zu exportieren, und schreiben Sie einen benutzerdefinierten DatasetBuilder für RLDS, wenn Sie die Open X-Embodiment-Kompatibilität benötigen.

Qualitätskontrolle

Die Qualität bestimmt die politische Leistung. Hier ist das 10-Punkte-QC-Framework, das wir bei RCSV verwenden und jedem Team empfehlen, Roboterdaten zu sammeln.

  1. Erfolgserklärung der Aufgaben: Jede Episode muss die gesamte Aufgabe erfolgreich abschließen. Fehlende Demonstrationen (abgesprungenen Objekte, fehlende Fänge, unvollständige Bahnen) schädigen aktiv die Politikbildung.
  2. Zeitmarken-Synchronisierung: Alle Sensorströme (Kameras, Gelenkzustände, Aktionen) müssen auf <5 ms Toleranz zeitmarkiert und synchronisiert werden. Verwenden Sie Hardware-ausgelöste Kameras (GPIO-Puls aus der Arbeitsstation) und eine gemeinsame Uhrquelle (chronische NTP oder IEEE 1588 PTP). Überprüfen Sie durch Aufzeichnung eines bekannten Ereignisses (Arm-Kontakttabelle) und die Überprüfung aller Ströme, die das Ereignis innerhalb von 5 ms zeigen.
  3. ** Streckenkonsistenz:** Bei einer bestimmten Aufgabe sollten Demonstrationen ähnliche Strategien folgen. Wenn Operator A von links und Operator B von rechts wählt, lernt die Politik eine zweideutige bimodale Verteilung, die in beiden Fällen fehlt.
  4. Szenenvielfalt: Systematisch variieren die Positionen von Objekten (zwangsläufig innerhalb eines definierten Grenzfelds), die Objektinstanzen (3-5 pro Kategorie), die Lichtbedingungen (übergeordnet, gewinkelter, schwach) und die Hintergrundunordnung. Dokumenten Sie die Parameter der Vielfalt für jede Sammelungssitzung. Ohne Vielfalt überschreitet die Richtlinie das genaue Szenenlayout Ihres Labors.
  5. Framenfallüberwachung: Kamera-Streams müssen auf gefallene Frames überprüft werden. Ein einzelner gefallener Frame schafft eine zeitliche Diskontinuität, die sich in sequenzbasierten Richtlinien verwirrt. Monitor Frame-Fall-Raten in Echtzeit. Ablehnen Episoden mit >2%-Framenverlust und untersuchen Sie die Ursache (USB-Bandbreite, Rechen-Flaschenhals).
  6. Greifer-Staatskonsistenz: Validieren Sie die Signale des Griffes offen/schließen gegen die Kamera-Beweise. Phantom-Greifer-Ereignisse (die Daten zeigen, dass der Griffes geschlossen wurde, aber die Kamera zeigt, dass es nicht war) sind überraschend häufig bei lauten Griffensoren. Flagge und korrigieren oder entsorgen betroffene Episoden.
  7. Gegensätzliche Grenzwerte für die gemeinsame Verteilung: Keine Episode darf gemeinsame Positionen außerhalb des sicheren Betriebsbereichs des Roboters enthalten.
  8. Episodenlänge: Definieren Sie die Mindest- und Höchst-Episodenlänge für Ihre Aufgabe. Episoden, die deutlich kürzer (Auftrag nicht abgeschlossen) oder länger (Betreiberzweifel, Wiederherstellung von nahezu fehlerhaften Folgen) als der erwartete Bereich sind, sollten zur Überprüfung gekennzeichnet werden.
  9. Metadatenvollständigkeit: Jede Episode benötigt: Aufgabenname, Operator-ID, Zeitstempel, Roboter-Serienummer, Kamera-Konfiguration, Erfolgs-/Fehler-Label und freie Textnotizen für Anomalien. Unvollständige Metadaten machen Datensatzmanagement, Qualitätsanalyse und Reproduzierbarkeit unmöglich.
  10. Kross-Operator-Konsistenz: Wenn mehrere Operatoren verwendet werden, vergleichen Sie die Streckenverteilung zwischen den Operatoren wöchentlich. Ein Operator, dessen Demonstrationen sich erheblich vom Konsens abweichen, sollte zurückgebildet oder ausgeschlossen werden.

Ausbau von Pilot- bis Produktion

Der Weg von einem Proof-of-Concept-Datensatz zu Daten in der Produktionsskala erfordert eine bewusste Infrastrukturinvestition in jeder Phase.

Stufe 1: Konzeptnachweis (50 Episoden)

Ein Operator, ein Roboter, eine Aufgabe. Das Ziel ist es, Ihre Teleoperations-Einstellung, Datenleitung und Trainingscode zu validieren. Trainieren Sie ein ACT- oder Diffusion-Politik-Modell auf diesen Daten und bewerten Sie auf dem echten Roboter. Wenn Sie mit 50 Demonstrationen einer einfachen Aufgabe nicht mehr als 70% Erfolg erzielen können, ist das Problem Datenqualität oder Pipeline-Bugs, nicht Datenmenge. Sammeln Sie keine weiteren Daten, bis Sie die Ursache behoben haben.

Zeitlinie: 1-3 Tage. Kosten (intern): $200-$500 in der Betriebszeit.

Stufe 2: Erstausbildung (200 Episoden)

Fügen Sie einen zweiten Operator hinzu, um zu bestätigen, dass Ihr Sammelprotokoll von einem Operator unabhängig ist. Führen Sie automatisierte Qualitätskontrollen durch: Episodenlänge-Grenzen, gemeinsame Grenzverletzungen, Erfolg/Niederlage-Klassifizierung. Beginnen Sie systematisch mit Qualitätsmessungen zu verfolgen. Dies ist die Phase, in der Sie den Erfolg von Politiken bei einfachen Aufgaben von 80-90%+ sehen sollten.

**Zeitlinie: ** 1-2 Wochen. ** Kosten (intern): ** $600- $1,500 in der Betriebszeit.

Stufe 3: Produktionspolitik (1.000 Episoden)

Bereitstellen Sie 2-4 parallele Sammelstationen mit identischen Hardware-Konfigurationen. Verwenden Sie eine zentrale Datenleitung, die Episoden aus allen Stationen zusammenfasst, Qualitätskontrollen durchführt und nächtlich schulungsbereite Datensätze erstellt. Auf dieser Skala wird das Betreibermanagement zum Engpäck: Rekrutieren, trainieren und behalten Sie 4-8 Betreiber, die über Wochen hinweg eine kohärente Qualität aufrechterhalten können.

Schlüsselinvestitionen:

  • Automatische Reset-Mechanismen: Verringern Sie die 15-60 Sekunden manuellen Scene-Reset-Methoden. Selbst wenn Sie 15 Sekunden pro Episode über 1.000 Episoden sparen, sparen Sie 4 Stunden oder mehr Operatorzeit.
  • Echtzeitqualitäts-Dashboards: Durchsatz pro Station, Erfolgsraten und Qualitätsmesswerte, die für Betreiber und Aufsichtsbehörden sichtbar sind.
  • Standardisierte Kalibrierung: Bei mehreren Stationen müssen die Kamera-Extrinsic und die Roboterbasiskalibrierung standardisiert werden.

Zeitlinie: 2-4 Wochen mit 2 Stationen. Kosten (intern): $3.000-$8.000 in Betriebszeit, $30K-$100K in Hardware.

Stufe 4: Stiftungsmodellbeiträge (10.000+ Episoden)

Sie können sich in der Lage versetzen, die Daten zu nutzen, um die Daten zu nutzen, die sich auf die Datenbasis ergeben.

**Zeitlinie: ** 2-6 Monate mit 4 Stationen. ** Kosten (intern): ** 15.000 bis 50.000 USD + in der Betriebszeit.

Oder: [aufstellen Sie RCSV, um in einer dieser Stufen zu sammeln]T6) und überspringen Sie den Bau der Infrastruktur vollständig.

Kostenrechner: In-House vs. RCSV verwaltet

Die tatsächliche Kosten der Datenerhebung zu verstehen, hilft Teams, fundierte Entscheidungen zu treffen. Hier ist ein realistischer Vergleich für eine 500-Episode-Single-Task-Kampagne.

Cost Category In-House RCSV Managed
Hardware (robot + teleop + cameras + compute) $15,000 - $35,000 $0 (included)
Infrastructure setup (workspace, calibration, software) $2,000 - $5,000 $0 (included)
Operator recruitment and training $1,000 - $3,000 $0 (included)
Operator labor (500 episodes at 20 demos/hr, $35/hr) $875 Included in campaign price
QA and quality review $500 - $1,500 $0 (included)
Engineer time (pipeline, debugging, monitoring) $5,000 - $15,000 $0
Total $24,375 - $60,375 $8,000 - $15,000
Effective cost per episode $49 - $121 $16 - $30

In-house-Kosten umfassen Hardware, die über eine einzige 500-Episode-Kampagne amortiziert wird. Wenn Sie planen, 5.000+-Episoden über 12 Monate zu sammeln, wird in-house in Skala wirtschaftlicher. Für einmalige oder anfängliche Kampagnen ist die verwaltete Sammlung in der Regel 2-4x kostengünstiger, wenn Sie die Zeit und die Gelegenheitskosten für Ingenieure berücksichtigen.

7 häufige Fehler, die Teams beim Sammeln ihrer ersten Datensätze machen

Nach einer ersten Datenerhebungssitzung mit Dutzenden von Teams sehen wir immer wieder dieselben Fehler.

  1. Sammeln Sie Daten, bevor Sie die Trainingspipeline validieren. Teams kaufen Hardware, sammeln 500 Episoden und entdecken dann, dass ihr Trainingscode einen Fehler hat, der alle Daten unbrauchbar macht. Trainieren Sie immer zuerst auf 10-20 Test-Episoden. Validieren Sie, dass Ihre Pipeline eine Politik erstellt, die den Roboter vernünftig bewegt (auch wenn er die Aufgabe nicht erfüllt) bevor Sie in Maßstab investieren.
  2. Unschätzung der Betriebsunterricht. Ein unerziehter Betriebsunternehmer erzeugt 3-5 mal schlechtere Daten als ein erziehter Betriebsunternehmer. Die ersten 20 Demonstrationen eines neuen Betriebsunternehmens sollten als Kalibrierungsdaten betrachtet und entsorgt werden.
  3. Inkonsistente Resets. Wenn die Szene nicht zwischen den Episoden konsequent reset wird, lernt die Politik eine Verteilung, die willkürliche Startzustände umfasst. Dies erhöht die Daten, die für das Lernen einer robusten Politik erforderlich sind, dramatisch.
  4. Die Qualität wird nicht in Echtzeit überwacht. Die Teams sammeln häufig einen ganzen Datensatz und entdecken dann, dass in den letzten 200 Episoden eine Kamera mit einer positionierten Position oder ein Grippersensor aufgetreten ist, der Phantomsignale erzeugt. Qualitätsmessungen in Echtzeit überwachen und Anomalien sofort feststellen.
  5. Ein falscher Aktionsraum aufzunehmen. Die Erfassung eines kartesischen Endefektors erfolgt, wenn Ihre Politik gemeinsame Positionen erwartet (oder umgekehrt) bedeutet, alles neu zu verarbeiten oder neu zu sammeln.
  6. Unbeachtet der Szenevielfalt. Eine Politik, die bei Demonstrationen mit dem Objekt immer in der gleichen Position ausgebildet ist, wird versagen, wenn das Objekt 5 cm nach links ist.
  7. Skip Metadaten. "Wir fügen Metadaten später hinzu" bedeutet "Wir werden niemals Metadaten hinzufügen". Aufzeichnen Sie den Aufgabennamen, die Operator-ID, den Zeitstempel, die Roboter-Serie, die Kamera-Konfiguration und das Erfolgs-/Fehler-Label in jeder einzelnen Episode. Dies kostet 10 Sekunden pro Episode und spart später Tage der Verwirrung.

Lassen Sie das RCSV Ihre Schulungsdaten sammeln

Das Robotics Center of Silicon Valley betreibt eine dedizierte Datenerhebungsinfrastruktur für ML-Teams, die qualitativ hochwertige Roboterdemonstrationsdaten benötigen, ohne ihre eigene Sammelleitungen zu erstellen.

  • Managed Data Collection: Von 50 Episoden-Pilot bis zu 10.000+ Episoden-Kampagnen. Sie geben die Aufgabe an; wir liefern den Datensatz im HDF5, RLDS oder LeRobot-Format.
  • Hardware-Pakete: Vorkonfigurierte Datenerfassungstationen (OpenArm + Kameras + Computer + Software) bereit für den Einsatz in Ihrem Labor.
  • Offene Datensätze: Durchsuchen Sie unsere Bibliothek mit öffentlich verfügbaren Datensätzen zur Roboternappilation.
  • Datenplattform: Laden Sie Ihre Datensätze hoch, visualisieren, qualifizieren und exportieren Sie sie über die RCSV Fearless Platform.

Sie brauchen Roboterdaten?

RCSV betreibt mehrstationsbasierte Datenerfassungsanlagen mit ausgebildeten Betreibern, qualitativ hochwertigen Pipelines und schneller Turnaround.

Datendienste Browse Datasets