Zurück zu Guides

Wie man Roboter-Trainingdaten sammelt: Schritt-für-Schritt-Leitfaden (2026)

Schritt-für-Schritt-Leitfaden zur Erhebung von Roboter-Training-Daten <unk> Hardware-Einstellung, Teleoperationsmethoden, Episode-Design, QA und Skalierung Ihres Datensatzes.

[← Führer]

Alles, was Sie über die Sammlung hochwertiger Roboter-Demonstrationsdaten wissen müssen von der Hardware-Einstellung und der Telebetriebsmethode bis hin zum Episodedesign, zur Qualitätskontrolle, zur Skalierung und zur Einnahme in Trainingsleitungen.

Bevor Sie anfangen: Was Sie brauchen

Die Datenerfassung ist die Grundlage für jede [Imitierung] Pipeline. Schlechte Daten erzeugen schlechte Richtlinien, unabhängig davon, wie anspruchsvoll Ihr Trainingsalgorithmus ist. Bevor Sie eine einzelne Episode aufnehmen, überprüfen Sie, ob Sie Folgendes haben:

Hardware-Checkliste

  • Roboterarm mit Positionsteuerung bei 50 Hz: ViperX-300 S2, Koch v1.1, OpenArm, Franka Emika Panda oder ähnlich. Der Arm muss gemeinsame Positionsbefehle bei 50 Hz oder höher akzeptieren und aktuelle gemeinsame Positionen mit der gleichen Geschwindigkeit melden.
  • Telebetriebsoberfläche: Leader-Follower-Arm (höchste Datenqualität), VR-Controller (Meta Quest 3, niedrigste Kosten) oder 3D-Maus (SpaceMouse, einfachste Einstellung).
  • Kameras: Mindest 2 Kameras 1 mit Handgelenkmontage (Intel RealSense D405 empfohlen) und 1 Obergewicht (RealSense D435 oder Logitech C920).
  • Workstation: Ubuntu 22.04 oder 24.04, NVIDIA GPU (jede moderne Karte funktioniert für die Datenerfassung GPU ist für das Training später), 500 GB+ NVMe SSD für die Aufbewahrung von Episoden. USB 3.0-Ports für Kamera- und Armverbindungen.
  • ** Aufnahmesystem:** LeRobot-Aufnahmestapel, ALOHA-Aufnahmeschriften oder benutzerdefinierter ROS2-Datenlogger.
  • Task-Objekte: Die Objekte, die Sie während der Datenerhebung manipulieren werden. Haben Sie möglichst viele Sie möchten die Objektinstanzen für die Verallgemeinerung variieren.
  • Backup-Speicher: Externe SSD- oder NAS-Backups für nächtliche Backups. Ein einzelner Tag der Datenerfassung erzeugt 2050 GB. Ein Tag der Erhebung durch einen Festplattenversagen zu verlieren, ist teuer.

Die Wahl der Teleoperationsmethode

Die von Ihnen gewählte Teleoperationsmethode beeinflusst die Datenqualität, die Sammelleistung und die Müdigkeit des Betreibers.

Entscheidungsträger: Aufgabepräzision zur Methode

  • Sub-Millimeter-Genauigkeit erforderlich (Einsetzen, Threading, feine Montage) → Leader-Follower-Arm. Die kinematische Übereinstimmung zwischen Führer und Anhänger bietet die beste Positionsgenauigkeit. Kosten: $6.000$10.000 für den Führer-Arm.
  • Genauigkeit auf Zentimeterniveau ausreichend (Pick-Place, Sortierung, Verpackung) → VR-Controller (Meta Quest 3). Natürliche Handbewegung, geringere Kosten ($500), schnelleres Operator-Onboarding. Geeignet für grobe Manipulationsarbeiten.
  • 6-DOF End-Effektor-Steuerung mit Kraftfeedback (kontaktreiche Aufgaben, Oberflächenverfolgung) → Fahr-Fahr-Arm mit Gravitationskompensation. Der Betreiber fühlt durch den Führerarm Widerstand, so dass kraftempfindliche Demonstrationen möglich sind.
  • Exterische Handmanipulation (Finger-Niveau-Häufung, Hand-Rotation) → Exoskelett-Handschuhe (SenseGlove Nova 2 oder HaptX G1). Siehe unseren [Bimanual-Setup-Guide]T12).
  • Schnelle Prototypisierung, Einfach-Achsen-AufgabenSpaceMouse oder Tastatur. Mindeste Eintrittsbarriere.

Für die meisten Team-Anfänger ist die Empfehlung: beginnen Sie mit einem Leader-Follower-Setup, wenn Sie es sich leisten können, oder VR-Controller, wenn das Budget begrenzt ist. Der Datenqualitätsunterschied ist messbar Führung-Follower-Daten erzeugen in der Regel 1015% höhere politische Erfolgsraten für Präzisions Aufgaben.

Kamera und Sensor-Einstellung

Die Kamera-Einstellung ist einer der unterbewertetesten Faktoren für die Qualität der Datenerfassung.

Kameraarten und wann man sie einsetzt

  • Handkamera (montiert auf Roboter-End-Effektor): Bietet einen Nahenblick auf den Manipulationspunkt. Wichtig für präzise Aufgaben (Einsetzen, feine Greifen). Bewegt sich mit dem Roboter, so dass es immer die Aktion einrahmt.
  • Overhead-Kamera (festige, auf den Arbeitsplatz blickt): Bietet einen globalen Szenenkontakt. Wesentlich für Pick-Place-Aufgaben, bei denen die Politik Objekte im Arbeitsplatz lokalisieren muss.
  • Side-Kamera (feste, in Tischhöhe): Erfasst Annäherungsbahnen und Verfassungsprofile, die von der Oberseite abgeschlossen sind. Nützlich für Aufgaben mit vertikaler Annäherung (Stapeln, Einfügen von oben).
  • ** Multi-View-Setup (3+ Kameras):** Der Standard für hochwertige Sammlung. ALOHA verwendet einen 3-Kamera-Stack: linken Handgelenk, rechte Handgelenk, Oberkopf. Das Hinzufügen von Kameras erhöht das Datenvolumen linear, verbessert aber die Robustheit der Politik für die Aussichtspunkte.

Montage- und Kalibrierungstipps

  • Verwenden Sie steife Aluminium-Extrusions- oder Stahlhalterungen.
  • Wenn eine Kamera auf den Kopf gerät, können Sie überprüfen, ob sie sich bewegt hat.
  • Kalibrieren Sie die Kamera-Extrinsics mit einem ArUco-Board vor jeder mehrtägigen Sammelkampagne.
  • Setzen Sie die Kameras auf manuelle Belichtung und festen Weißgleichen.
  • Überprüfen Sie die Rahmen-Synchronisierung: Kameras und gemeinsame Daten müssen von der gleichen Uhr aus Zeitstempel versehen sein. Verwenden Sie Hardware-Trigger (RealSense Multi-Cam-Synchronisation) oder Software-Synchronisierung über eine gemeinsame NTP-Uhr.

Episode Design

Eine "Episode" ist eine einzige Demonstration der Aufgabe von Anfang bis Ende.

Die Aufgabe definiert

Schreiben Sie vor dem Sammeln von Daten eine genaue Aufgabenbeschreibung.

  • ** Aufgabe Ziel:** "Holt den roten Würfel vom Tisch und leg ihn in die blaue Schüssel".
  • ** Erfolgskriterien:** "Der Würfel ist in der Schüssel, der Griff ist geöffnet und der Arm ist wieder in die Position zurückgekehrt".
  • Erlaubte Strategien: "Nach dem Würfel von oben mit einem Top-Down-Griff ansprechen". Oder explizit: "Jeder Grip-Ansatz ist akzeptabel". Wenn Sie eine Strategie beschränken, erhalten Sie konsistentere Daten (besser für ACT).
  • Episode Dauer: Definieren Sie eine maximale Episode Länge. Typischer Tisch-Pick-Place: 515 Sekunden. Wenn eine Episode 2x die Median-Dauer überschreitet, ist etwas schief gegangen Werfen Sie sie weg.

Start der staatlichen Verteilung

Die Ausgangs-Stand-Verteilung bestimmt die Einsatzfestigkeit Ihrer Politik. Wenn jede Demonstration mit dem Objekt in der gleichen Position beginnt, wird die Politik versagt, wenn das Objekt 3 cm nach links ist.

  • Phase 1 (erste 50 Demo): Verwenden Sie eine kleine Start-State-Verteilung.
  • Phase 2 (Demos 51200): Erweitern Sie die vorgesehene Bereitstellung auf die gesamte Bereitstellung.
  • Phase 3 (Demos 200+): Fügen Sie Ablenker, Objektvarianten, Lichtvariationen und Hintergrundänderungen hinzu.

Das Protokoll zur Wiederherstellung

Zwischen den Episoden müssen Sie die Szene in einen gültigen Startzustand zurücksetzen.

  1. Rückkehr des Roboter in die Heimkonfiguration (vordefinierte gemeinsame Positionen).
  2. Stellen Sie das Aufgabenobjekt in eine neue Position innerhalb der Start-State-Verteilung.
  3. Überprüfen Sie, ob die Szene der Aufgabenbeschreibung entspricht (Objekt sichtbar, keine Verstopfung, Griff offen).
  4. Warten Sie 1 Sekunde, bis sich die Szene niederlegt (keine Restobjektbewegung).
  5. Beginnen Sie mit der Aufnahme.

Schlechte Resets sind die wichtigste Quelle für schlechte Episoden.

Aufnahme Ihrer ersten 10 Episoden

Die ersten 10 Episoden sind über die Validierung Ihrer Pipeline, nicht über die Erhebung von Trainingsdaten.

Schritt für Schritt durchlaufen

  1. Start das Aufnahmeskript. Überprüfen Sie, ob HDF5 in das richtige Verzeichnis geschrieben wird. Überprüfen Sie, ob die Dateigröße während der Aufnahme wächst (deutet darauf hin, dass Daten fließen).
  2. Position des Betreibers. Der Betreiber sollte bequem an der Telebetriebsoberfläche sitzen oder stehen, um den Arbeitsplatz klar zu sehen.
  3. Bild Episode 1. Führen Sie die Aufgabe reibungslos aus. Beeilen Sie sich nicht reibungslose, bewusste Bewegungen erzeugen bessere Richtlinien als schnelle, zerbrechende. Typische Geschwindigkeit: 5070% der schnellsten, die Sie gehen könnten.
  4. Stoppen Sie die Aufnahme und überprüfen Sie die Episode. Öffnen Sie die HDF5-Datei.
  • Die gemeinsamen Positionsdaten (T3) haben die erwartete Anzahl der Zeitstufen (Episode/Zeit/Sekunden x 50 Hz).
  • Die Kamerabilder (T4) haben die erwartete Bildflächenzahl (Zeit x 30 fps).
  • Die Aktionsdaten (T5) entsprechen den gemeinsamen Positionsdimensionen.
  • Wiedergabe der Bilder und überprüfe, ob sie mit den gemeinsamen Daten synchron sind.
  1. Episode 210. Verändern Sie leicht die Startpositionen.
  2. ** Führen Sie einen Trainingstest durch.** Führen Sie diese 10 Episoden in Ihr Trainingsscript ein. Sie erwarten keine gute Politik Sie überprüfen, ob die Trainingsleitung Ihr Datenformat ohne Fehler akzeptiert. Wenn das Training ohne Absturz abgeschlossen wird, wird Ihre Pipeline validiert.

Qualitätskontrolle für jede Episode

Jede Episode sollte diese 8-Punkte-Qualitäts-Checklist überschreiten, bevor sie in den Trainingsdataset hinzugefügt wird.

8-Punkte-Episode QA Checkliste

  1. Task erfolgreich abgeschlossen? Die Episode endet mit dem Aufgabenziel, das nach den Erfolgskriterien erreicht wurde.
  2. Kein Zögern des Betreibers > 2 Sekunden? Lange Pausen in der Mitte der Aufgabe erzeugen "stationäre" Datenpunkte, die die Politik verwirren.
  3. Glanz trajektoriell? Wiederholen Sie die gemeinsamen Positionsdaten. Suchen Sie nach plötzlichen Sprüngen (Teleoperationsfehler), Schwingungen (Unsicherheit des Steuerers) oder unnatürlichen Geschwindigkeitsänderungen.
  4. ** Kamerabilder klar?** Überprüfen Sie, ob die Bewegung verschwommen ist, der Manipulationspunkt verborgen ist und die Aufdeckung korrekt ist.
  5. ** Richtiger Startzustand?** Überprüfen Sie, ob die Episode von der vorgesehenen Start-State-Verteilung ausgeht.
  6. Episode Dauer innerhalb der Grenzen? Die Dauer sollte innerhalb von 2 Standardabweichungen vom Mittel liegen. Anomalie kurze Episoden können unvollständige Aufgaben anzeigen. Anomalie lange Episoden zeigen die Schwierigkeiten des Betreibers an.
  7. ** Datenintegrität?** HDF5 Datei ist nicht beschädigt. Alle erwarteten Datenfelder sind vorhanden. Zeitstempel zunehmen monotonisch. Keine NaN-Werte in gemeinsamen Daten.
  8. Konsistente Strategie? Wenn Sie eine Strategie beschränken (zur ACT empfohlen), überprüfen Sie, ob die Episode dem bezeichneten Ansatz folgt.

Häufige Datenerhebungsfehler

1. Ungleiche Kameraposition zwischen den Sitzungen

** Was passiert:** Sie sammeln 100 Episoden am Montag, dann stoßen Sie die Oberkamera beim Reinigen. Die 100 Episoden am Dienstag haben einen etwas anderen Standpunkt. Der gemischte Datensatz trainiert eine Politik, die aus beiden Standpunkten schlecht funktioniert.

Fix: Kameraen fest montieren. Fotografieren Sie die Kamerapositionen. Beginn jeder Sitzung überprüfen Sie die Kamera-Extrinsics mit einer Referenz-ArUco-Boardkalibrierung. Wenn die Kalibrierung verschoben ist, montieren Sie sie vor der Sammlung erneut.

2. Betriebsmüdigkeit, die Datenqualität verschlechtert

** Was passiert:** Die ersten 50 Episoden des Tages sind reibungslos und präzise. Bis zu Episode 150 ist der Betreiber müde Demonstrationen sind schwieriger, langsamer und weniger konsistent. Die Politik lernt einen Durchschnitt von guten und schlechten Demonstrationen.

Fix: Durchsetzen Sie alle 45 Minuten 10-minütige Pausen. Begrenzen Sie die Sammelstunden auf 4 Stunden pro Betreiber pro Tag. Überwachen Sie Qualitätsmesswerte (Episodendaufzeit, Streckenlautheit) im Laufe der Zeit und stoppen Sie die Sammlung, wenn sich die Qualität verschlechtert.

3. Schmaler Start-State-Verteilung

** Was passiert:** Alle Demonstrationen beginnen mit dem Objekt in ungefähr derselben Position.

Fix: Systematisch zu randomisieren, objektpositionen während der sammlung. Verwenden sie ein grid-muster: teilen sie den arbeitsraum in ein 4x4-grid und sammeln sie mindestens 3 episoden, die von jeder gridzel beginnen. verfolgen sie den start-zustand-deckung als datensatzmetrik.

4. Nicht Validierung der Aufnahmegeschäft vor der Skalierung

Was passiert: Sie sammeln 500 Episoden über eine Woche, dann entdecken Sie, dass die Aktionsdaten aufgrund eines Konfigurationsfehlers bei 25 Hz statt 50 Hz aufgezeichnet wurden.

Fix: Validieren Sie immer mit 10 Test-Episoden zuerst. Führen Sie die komplette Trainingsleitung auf diesen 10 Episoden durch. Überprüfen Sie Datendimensionen, Frequenzen und Formatkompatibilität, bevor Sie in eine groß angelegte Sammlung investieren.

5. Mischstrategie in einem kleinen Datensatz

Was passiert: Drei Betreiber verwenden jeweils einen anderen Ansatz. Mit nur 150 Gesamtrepisoden (50 pro Ansatz) verfügt kein einzelner Ansatz über ausreichende Daten. ACT durchschnittlich die Ansätze und erzeugt eine ungültige mittlere Flugbahn.

Fix: Für Datensätze unter 300 Episoden standardisieren Sie auf einer einzigen Strategie. Schulen Sie die Betreiber, dasselbe Ansatz zu verwenden. Für größere Datensätze (300+) sind mehrere Strategien in Ordnung Betrachten Sie die Diffusion Policy, die die Multi-modalität nativ behandelt.

6. Ignorieren der Lichtvariation

** Was passiert:** Alle Daten werden unter einer einheitlichen Laborbeleuchtung erfasst.

Fix: Während der Phase 2 und 3 der Sammlung ändert die Beleuchtung absichtlich. Schalten Sie die Oberbeleuchtung für einige Episoden aus. Fügen Sie eine Schreibtischlampe aus verschiedenen Winkeln hinzu. Schließen/öffnen Sie Fensterblenden. Dies zwingt den visuellen Encoder, Licht-invariante Funktionen zu lernen.

Ausmaß von 50 bis 500 Episoden

Die Skalierung der Datenerhebung führt zu organisatorischen Herausforderungen, die nicht auf kleinem Maßstab existieren.

Ausbildungsmaßnahmen für Betreiber

Bei der Zugabe neuer Betreiber über die ursprüngliche 12 hinaus:

  • Lassen Sie neue Betreiber 10 Beispiel-Episoden sehen, bevor sie beginnen.
  • 20 Übungs-Episoden, die die QA überschreiten, bevor man den Datensatz zählt.
  • Paare neue Betreiber mit einem erfahrenen Betreiber für die erste Sitzung.
  • Qualitätsmesswerte pro Tracker: Durchschnittliche Episodendauer, Streckenflüssigkeitsscore, Qualitätssicherungs-Ablehnungsschnitt.

Schalterplanung

Für große Sammlungen (500+ Episoden):

  • Planung von 23 Betreibern pro Tag in 3-stündigen Schichten mit einer Überschneidung von 30 Minuten für die Übertragung.
  • Jede Schicht erzeugt etwa 4060 Episoden (bei 34 Minuten pro Episode einschließlich Reset und QA).
  • Eine Person als "Datenleader" zu benennen, die am Ende eines jeden Tages Qualitätsmesswerte überprüft und die Abbau feststellt.
  • Budget: Bei RCSV-Sätzen sammeln professionelle Betreiber bei 1525 US-Dollar pro validierte Episode einschließlich QA. Die Kosten für die Inhouse-Sammlung variieren, aber laufen in der Regel bei der Berechnung der Betreiberzeit und der Gesamtkosten bei 815 US-Dollar pro Episode.

Qualitätszerstörungserkennung

Diese Messwerte werden bei der großen Sammlung täglich überwacht:

  • Durchschnittliche Episodendauer: Sollte stabil bleiben (±10%).
  • QA-Ablehnungsrate: Sollte unter 15% bleiben, wenn sie über 20% steigt, sollte die Abholung beendet und untersucht werden.
  • Gleichheit der Strecke: Berechnen Sie die Schlagzeile (Dritte Positionderivative) jeder Episode.
  • Start-State-Coverage: Auf einer 2D-Wärmeplanstellung die Startpositionen aufzeigen. Überprüfen Sie die einheitliche Abdeckung über die vorgesehene Verteilung hinweg.

Datenspeicherung und Organisation

Ordnerstruktur

project-name/
  raw/
    2026-04-12/
      episode_001.hdf5
      episode_002.hdf5
      ...
    2026-04-13/
      episode_101.hdf5
      ...
  validated/
    episode_001.hdf5    # passed QA
    episode_002.hdf5
    ...
  rejected/
    episode_045.hdf5    # failed QA, kept for reference
    ...
  metadata/
    collection_log.csv  # operator, date, start_state, duration, QA status
    camera_calibration_2026-04-12.json
    task_specification.md
  training/
    train/              # 85-90% of validated episodes
    val/                # 10-15% of validated episodes

Namensgebende Kongresse

  • Episodendateien: T6 (z.B. T7).
  • In die HDF5-Dateiattribute enthalten Sie Metadaten: Operator-ID, Datumsammlung, Startstatusbeschreibung, QA-Status, Aufgabenname.
  • Wenn Sie Episode 45 löschen, ist die nächste Episode immer noch 46, nicht 45.

Sicherungssysteme

  • Täglich: Synchronisieren Sie die Roh- oder Verzeichnis auf eine externe SSD oder NAS.
  • Wochenlich: Laden Sie das validierte Verzeichnis/Verzeichnis in den Cloud-Speicher (AWS S3, Google Cloud Storage) hoch.
  • Nach jeder Sammelkampagne: Erstellen Sie ein versionisiertes Archiv (z.B. T8) und laden Sie es in den gemeinsamen Speicher Ihres Teams hoch.
  • Wenn Sie Daten ändern müssen (z.B. Ernteepisoden, Zeitstempel beheben), erstellen Sie eine neue Datei und halten Sie die Originaldatei in Roh/.

Aufladen in die Ausbildungspiebel

LeRobot-Eingestion

Um Ihren HDF5-Datenbestand in LeRobot-Format für die Ausbildung mit ACT oder Diffusion Policy umzuwandeln:

# Convert HDF5 episodes to LeRobot Parquet format
python -m lerobot.scripts.convert_dataset \
  --raw-dir ./validated/ \
  --repo-id my-org/my-task-v1 \
  --raw-format hdf5_aloha

# Verify the converted dataset
python -m lerobot.scripts.visualize_dataset \
  --repo-id my-org/my-task-v1 \
  --episode-index 0

Überprüfung der Strukturen des HDF5

Vor dem Umwandeln überprüfen Sie, ob Ihre HDF5-Dateien die erwartete Struktur enthalten:

# Quick verification script
import h5py
import numpy as np

with h5py.File('episode_0001.hdf5', 'r') as f:
    # Check required fields
    assert 'observations' in f
    assert 'action' in f

    qpos = f['observations/qpos'][:]
    images = f['observations/images/cam_high'][:]
    actions = f['action'][:]

    print(f"Joint data: {qpos.shape}")    # expect (T, num_joints)
    print(f"Images: {images.shape}")       # expect (T_img, H, W, 3)
    print(f"Actions: {actions.shape}")     # expect (T, num_joints)

    # Check for NaN values
    assert not np.any(np.isnan(qpos)), "NaN in joint data!"
    assert not np.any(np.isnan(actions)), "NaN in actions!"

    # Check timestamp monotonicity
    if 'timestamps' in f:
        ts = f['timestamps'][:]
        assert np.all(np.diff(ts) > 0), "Non-monotonic timestamps!"

Für detaillierte Format-Spezifikationen und Konvertierung zwischen HDF5, RLDS und LeRobot-Formaten siehe unseren Datenformat-Leitfaden.

Benötigen Sie Hilfe bei der Datenerhebung?

RCSV verwaltet den gesamten Datenerfassungsprozess ausgebildete Betreiber, kalibrierte Hardware, Episode QA und Lieferung in Ihrem Zielformat. Wir haben über 50.000 Manipulationsepisoden in mehr als 30 Aufgabenarten gesammelt.

[Schauen Sie die Datenerhebungssysteme]