Wie man Roboter-Trainingdaten sammelt: Schritt-für-Schritt-Leitfaden (2026)
Schritt-für-Schritt-Leitfaden zur Erhebung von Roboter-Training-Daten <unk> Hardware-Einstellung, Teleoperationsmethoden, Episode-Design, QA und Skalierung Ihres Datensatzes.
[← Führer]
Alles, was Sie über die Sammlung hochwertiger Roboter-Demonstrationsdaten wissen müssen
Bevor Sie anfangen: Was Sie brauchen
Die Datenerfassung ist die Grundlage für jede [Imitierung] Pipeline. Schlechte Daten erzeugen schlechte Richtlinien, unabhängig davon, wie anspruchsvoll Ihr Trainingsalgorithmus ist. Bevor Sie eine einzelne Episode aufnehmen, überprüfen Sie, ob Sie Folgendes haben:
Hardware-Checkliste
- Roboterarm mit Positionsteuerung bei 50 Hz: ViperX-300 S2, Koch v1.1, OpenArm, Franka Emika Panda oder ähnlich. Der Arm muss gemeinsame Positionsbefehle bei 50 Hz oder höher akzeptieren und aktuelle gemeinsame Positionen mit der gleichen Geschwindigkeit melden.
- Telebetriebsoberfläche: Leader-Follower-Arm (höchste Datenqualität), VR-Controller (Meta Quest 3, niedrigste Kosten) oder 3D-Maus (SpaceMouse, einfachste Einstellung).
- Kameras: Mindest 2 Kameras
1 mit Handgelenkmontage (Intel RealSense D405 empfohlen) und 1 Obergewicht (RealSense D435 oder Logitech C920). - Workstation: Ubuntu 22.04 oder 24.04, NVIDIA GPU (jede moderne Karte funktioniert für die Datenerfassung
GPU ist für das Training später), 500 GB+ NVMe SSD für die Aufbewahrung von Episoden. USB 3.0-Ports für Kamera- und Armverbindungen. - ** Aufnahmesystem:** LeRobot-Aufnahmestapel, ALOHA-Aufnahmeschriften oder benutzerdefinierter ROS2-Datenlogger.
- Task-Objekte: Die Objekte, die Sie während der Datenerhebung manipulieren werden. Haben Sie möglichst viele
Sie möchten die Objektinstanzen für die Verallgemeinerung variieren. - Backup-Speicher: Externe SSD- oder NAS-Backups für nächtliche Backups. Ein einzelner Tag der Datenerfassung erzeugt 20
50 GB. Ein Tag der Erhebung durch einen Festplattenversagen zu verlieren, ist teuer.
Die Wahl der Teleoperationsmethode
Die von Ihnen gewählte Teleoperationsmethode beeinflusst die Datenqualität, die Sammelleistung und die Müdigkeit des Betreibers.
Entscheidungsträger: Aufgabepräzision zur Methode
- Sub-Millimeter-Genauigkeit erforderlich (Einsetzen, Threading, feine Montage) → Leader-Follower-Arm. Die kinematische Übereinstimmung zwischen Führer und Anhänger bietet die beste Positionsgenauigkeit. Kosten: $6.000
$10.000 für den Führer-Arm. - Genauigkeit auf Zentimeterniveau ausreichend (Pick-Place, Sortierung, Verpackung) → VR-Controller (Meta Quest 3). Natürliche Handbewegung, geringere Kosten ($500), schnelleres Operator-Onboarding. Geeignet für grobe Manipulationsarbeiten.
- 6-DOF End-Effektor-Steuerung mit Kraftfeedback (kontaktreiche Aufgaben, Oberflächenverfolgung) → Fahr-Fahr-Arm mit Gravitationskompensation. Der Betreiber fühlt durch den Führerarm Widerstand, so dass kraftempfindliche Demonstrationen möglich sind.
- Exterische Handmanipulation (Finger-Niveau-Häufung, Hand-Rotation) → Exoskelett-Handschuhe (SenseGlove Nova 2 oder HaptX G1). Siehe unseren [Bimanual-Setup-Guide]
T12 ). - Schnelle Prototypisierung, Einfach-Achsen-Aufgaben → SpaceMouse oder Tastatur. Mindeste Eintrittsbarriere.
Für die meisten Team-Anfänger ist die Empfehlung: beginnen Sie mit einem Leader-Follower-Setup, wenn Sie es sich leisten können, oder VR-Controller, wenn das Budget begrenzt ist. Der Datenqualitätsunterschied ist messbar
Kamera und Sensor-Einstellung
Die Kamera-Einstellung ist einer der unterbewertetesten Faktoren für die Qualität der Datenerfassung.
Kameraarten und wann man sie einsetzt
- Handkamera (montiert auf Roboter-End-Effektor): Bietet einen Nahenblick auf den Manipulationspunkt. Wichtig für präzise Aufgaben (Einsetzen, feine Greifen). Bewegt sich mit dem Roboter, so dass es immer die Aktion einrahmt.
- Overhead-Kamera (festige, auf den Arbeitsplatz blickt): Bietet einen globalen Szenenkontakt. Wesentlich für Pick-Place-Aufgaben, bei denen die Politik Objekte im Arbeitsplatz lokalisieren muss.
- Side-Kamera (feste, in Tischhöhe): Erfasst Annäherungsbahnen und Verfassungsprofile, die von der Oberseite abgeschlossen sind. Nützlich für Aufgaben mit vertikaler Annäherung (Stapeln, Einfügen von oben).
- ** Multi-View-Setup (3+ Kameras):** Der Standard für hochwertige Sammlung. ALOHA verwendet einen 3-Kamera-Stack: linken Handgelenk, rechte Handgelenk, Oberkopf. Das Hinzufügen von Kameras erhöht das Datenvolumen linear, verbessert aber die Robustheit der Politik für die Aussichtspunkte.
Montage- und Kalibrierungstipps
- Verwenden Sie steife Aluminium-Extrusions- oder Stahlhalterungen.
- Wenn eine Kamera auf den Kopf gerät, können Sie überprüfen, ob sie sich bewegt hat.
- Kalibrieren Sie die Kamera-Extrinsics mit einem ArUco-Board vor jeder mehrtägigen Sammelkampagne.
- Setzen Sie die Kameras auf manuelle Belichtung und festen Weißgleichen.
- Überprüfen Sie die Rahmen-Synchronisierung: Kameras und gemeinsame Daten müssen von der gleichen Uhr aus Zeitstempel versehen sein. Verwenden Sie Hardware-Trigger (RealSense Multi-Cam-Synchronisation) oder Software-Synchronisierung über eine gemeinsame NTP-Uhr.
Episode Design
Eine "Episode" ist eine einzige Demonstration der Aufgabe von Anfang bis Ende.
Die Aufgabe definiert
Schreiben Sie vor dem Sammeln von Daten eine genaue Aufgabenbeschreibung.
- ** Aufgabe Ziel:** "Holt den roten Würfel vom Tisch und leg ihn in die blaue Schüssel".
- ** Erfolgskriterien:** "Der Würfel ist in der Schüssel, der Griff ist geöffnet und der Arm ist wieder in die Position zurückgekehrt".
- Erlaubte Strategien: "Nach dem Würfel von oben mit einem Top-Down-Griff ansprechen". Oder explizit: "Jeder Grip-Ansatz ist akzeptabel". Wenn Sie eine Strategie beschränken, erhalten Sie konsistentere Daten (besser für ACT).
- Episode Dauer: Definieren Sie eine maximale Episode Länge. Typischer Tisch-Pick-Place: 5
15 Sekunden. Wenn eine Episode 2x die Median-Dauer überschreitet, ist etwas schief gegangen Werfen Sie sie weg.
Start der staatlichen Verteilung
Die Ausgangs-Stand-Verteilung bestimmt die Einsatzfestigkeit Ihrer Politik. Wenn jede Demonstration mit dem Objekt in der gleichen Position beginnt, wird die Politik versagt, wenn das Objekt 3 cm nach links ist.
- Phase 1 (erste 50 Demo): Verwenden Sie eine kleine Start-State-Verteilung.
- Phase 2 (Demos 51
200): Erweitern Sie die vorgesehene Bereitstellung auf die gesamte Bereitstellung. - Phase 3 (Demos 200+): Fügen Sie Ablenker, Objektvarianten, Lichtvariationen und Hintergrundänderungen hinzu.
Das Protokoll zur Wiederherstellung
Zwischen den Episoden müssen Sie die Szene in einen gültigen Startzustand zurücksetzen.
- Rückkehr des Roboter in die Heimkonfiguration (vordefinierte gemeinsame Positionen).
- Stellen Sie das Aufgabenobjekt in eine neue Position innerhalb der Start-State-Verteilung.
- Überprüfen Sie, ob die Szene der Aufgabenbeschreibung entspricht (Objekt sichtbar, keine Verstopfung, Griff offen).
- Warten Sie 1 Sekunde, bis sich die Szene niederlegt (keine Restobjektbewegung).
- Beginnen Sie mit der Aufnahme.
Schlechte Resets sind die wichtigste Quelle für schlechte Episoden.
Aufnahme Ihrer ersten 10 Episoden
Die ersten 10 Episoden sind über die Validierung Ihrer Pipeline, nicht über die Erhebung von Trainingsdaten.
Schritt für Schritt durchlaufen
- Start das Aufnahmeskript. Überprüfen Sie, ob HDF5 in das richtige Verzeichnis geschrieben wird. Überprüfen Sie, ob die Dateigröße während der Aufnahme wächst (deutet darauf hin, dass Daten fließen).
- Position des Betreibers. Der Betreiber sollte bequem an der Telebetriebsoberfläche sitzen oder stehen, um den Arbeitsplatz klar zu sehen.
- Bild Episode 1. Führen Sie die Aufgabe reibungslos aus. Beeilen Sie sich nicht
reibungslose, bewusste Bewegungen erzeugen bessere Richtlinien als schnelle, zerbrechende. Typische Geschwindigkeit: 50 70% der schnellsten, die Sie gehen könnten. - Stoppen Sie die Aufnahme und überprüfen Sie die Episode. Öffnen Sie die HDF5-Datei.
- Die gemeinsamen Positionsdaten (
T3 ) haben die erwartete Anzahl der Zeitstufen (Episode/Zeit/Sekunden x 50 Hz). - Die Kamerabilder (
T4 ) haben die erwartete Bildflächenzahl (Zeit x 30 fps). - Die Aktionsdaten (
T5 ) entsprechen den gemeinsamen Positionsdimensionen. - Wiedergabe der Bilder und überprüfe, ob sie mit den gemeinsamen Daten synchron sind.
- Episode 2
10. Verändern Sie leicht die Startpositionen. - ** Führen Sie einen Trainingstest durch.** Führen Sie diese 10 Episoden in Ihr Trainingsscript ein. Sie erwarten keine gute Politik
Sie überprüfen, ob die Trainingsleitung Ihr Datenformat ohne Fehler akzeptiert. Wenn das Training ohne Absturz abgeschlossen wird, wird Ihre Pipeline validiert.
Qualitätskontrolle für jede Episode
Jede Episode sollte diese 8-Punkte-Qualitäts-Checklist überschreiten, bevor sie in den Trainingsdataset hinzugefügt wird.
8-Punkte-Episode QA Checkliste
- Task erfolgreich abgeschlossen? Die Episode endet mit dem Aufgabenziel, das nach den Erfolgskriterien erreicht wurde.
- Kein Zögern des Betreibers > 2 Sekunden? Lange Pausen in der Mitte der Aufgabe erzeugen "stationäre" Datenpunkte, die die Politik verwirren.
- Glanz trajektoriell? Wiederholen Sie die gemeinsamen Positionsdaten. Suchen Sie nach plötzlichen Sprüngen (Teleoperationsfehler), Schwingungen (Unsicherheit des Steuerers) oder unnatürlichen Geschwindigkeitsänderungen.
- ** Kamerabilder klar?** Überprüfen Sie, ob die Bewegung verschwommen ist, der Manipulationspunkt verborgen ist und die Aufdeckung korrekt ist.
- ** Richtiger Startzustand?** Überprüfen Sie, ob die Episode von der vorgesehenen Start-State-Verteilung ausgeht.
- Episode Dauer innerhalb der Grenzen? Die Dauer sollte innerhalb von 2 Standardabweichungen vom Mittel liegen. Anomalie kurze Episoden können unvollständige Aufgaben anzeigen. Anomalie lange Episoden zeigen die Schwierigkeiten des Betreibers an.
- ** Datenintegrität?** HDF5 Datei ist nicht beschädigt. Alle erwarteten Datenfelder sind vorhanden. Zeitstempel zunehmen monotonisch. Keine NaN-Werte in gemeinsamen Daten.
- Konsistente Strategie? Wenn Sie eine Strategie beschränken (zur ACT empfohlen), überprüfen Sie, ob die Episode dem bezeichneten Ansatz folgt.
Häufige Datenerhebungsfehler
1. Ungleiche Kameraposition zwischen den Sitzungen
** Was passiert:** Sie sammeln 100 Episoden am Montag, dann stoßen Sie die Oberkamera beim Reinigen. Die 100 Episoden am Dienstag haben einen etwas anderen Standpunkt. Der gemischte Datensatz trainiert eine Politik, die aus beiden Standpunkten schlecht funktioniert.
Fix: Kameraen fest montieren. Fotografieren Sie die Kamerapositionen. Beginn jeder Sitzung überprüfen Sie die Kamera-Extrinsics mit einer Referenz-ArUco-Boardkalibrierung. Wenn die Kalibrierung verschoben ist, montieren Sie sie vor der Sammlung erneut.
2. Betriebsmüdigkeit, die Datenqualität verschlechtert
** Was passiert:** Die ersten 50 Episoden des Tages sind reibungslos und präzise. Bis zu Episode 150 ist der Betreiber müde
Fix: Durchsetzen Sie alle 45 Minuten 10-minütige Pausen. Begrenzen Sie die Sammelstunden auf 4 Stunden pro Betreiber pro Tag. Überwachen Sie Qualitätsmesswerte (Episodendaufzeit, Streckenlautheit) im Laufe der Zeit und stoppen Sie die Sammlung, wenn sich die Qualität verschlechtert.
3. Schmaler Start-State-Verteilung
** Was passiert:** Alle Demonstrationen beginnen mit dem Objekt in ungefähr derselben Position.
Fix: Systematisch zu randomisieren, objektpositionen während der sammlung. Verwenden sie ein grid-muster: teilen sie den arbeitsraum in ein 4x4-grid und sammeln sie mindestens 3 episoden, die von jeder gridzel beginnen. verfolgen sie den start-zustand-deckung als datensatzmetrik.
4. Nicht Validierung der Aufnahmegeschäft vor der Skalierung
Was passiert: Sie sammeln 500 Episoden über eine Woche, dann entdecken Sie, dass die Aktionsdaten aufgrund eines Konfigurationsfehlers bei 25 Hz statt 50 Hz aufgezeichnet wurden.
Fix: Validieren Sie immer mit 10 Test-Episoden zuerst. Führen Sie die komplette Trainingsleitung auf diesen 10 Episoden durch. Überprüfen Sie Datendimensionen, Frequenzen und Formatkompatibilität, bevor Sie in eine groß angelegte Sammlung investieren.
5. Mischstrategie in einem kleinen Datensatz
Was passiert: Drei Betreiber verwenden jeweils einen anderen Ansatz. Mit nur 150 Gesamtrepisoden (50 pro Ansatz) verfügt kein einzelner Ansatz über ausreichende Daten. ACT durchschnittlich die Ansätze und erzeugt eine ungültige mittlere Flugbahn.
Fix: Für Datensätze unter 300 Episoden standardisieren Sie auf einer einzigen Strategie. Schulen Sie die Betreiber, dasselbe Ansatz zu verwenden. Für größere Datensätze (300+) sind mehrere Strategien in Ordnung
6. Ignorieren der Lichtvariation
** Was passiert:** Alle Daten werden unter einer einheitlichen Laborbeleuchtung erfasst.
Fix: Während der Phase 2 und 3 der Sammlung ändert die Beleuchtung absichtlich. Schalten Sie die Oberbeleuchtung für einige Episoden aus. Fügen Sie eine Schreibtischlampe aus verschiedenen Winkeln hinzu. Schließen/öffnen Sie Fensterblenden. Dies zwingt den visuellen Encoder, Licht-invariante Funktionen zu lernen.
Ausmaß von 50 bis 500 Episoden
Die Skalierung der Datenerhebung führt zu organisatorischen Herausforderungen, die nicht auf kleinem Maßstab existieren.
Ausbildungsmaßnahmen für Betreiber
Bei der Zugabe neuer Betreiber über die ursprüngliche 1
- Lassen Sie neue Betreiber 10 Beispiel-Episoden sehen, bevor sie beginnen.
- 20 Übungs-Episoden, die die QA überschreiten, bevor man den Datensatz zählt.
- Paare neue Betreiber mit einem erfahrenen Betreiber für die erste Sitzung.
- Qualitätsmesswerte pro Tracker: Durchschnittliche Episodendauer, Streckenflüssigkeitsscore, Qualitätssicherungs-Ablehnungsschnitt.
Schalterplanung
Für große Sammlungen (500+ Episoden):
- Planung von 2
3 Betreibern pro Tag in 3-stündigen Schichten mit einer Überschneidung von 30 Minuten für die Übertragung. - Jede Schicht erzeugt etwa 40
60 Episoden (bei 3 4 Minuten pro Episode einschließlich Reset und QA). - Eine Person als "Datenleader" zu benennen, die am Ende eines jeden Tages Qualitätsmesswerte überprüft und die Abbau feststellt.
- Budget: Bei RCSV-Sätzen sammeln professionelle Betreiber bei 15
25 US-Dollar pro validierte Episode einschließlich QA. Die Kosten für die Inhouse-Sammlung variieren, aber laufen in der Regel bei der Berechnung der Betreiberzeit und der Gesamtkosten bei 8 15 US-Dollar pro Episode.
Qualitätszerstörungserkennung
Diese Messwerte werden bei der großen Sammlung täglich überwacht:
- Durchschnittliche Episodendauer: Sollte stabil bleiben (±10%).
- QA-Ablehnungsrate: Sollte unter 15% bleiben, wenn sie über 20% steigt, sollte die Abholung beendet und untersucht werden.
- Gleichheit der Strecke: Berechnen Sie die Schlagzeile (Dritte Positionderivative) jeder Episode.
- Start-State-Coverage: Auf einer 2D-Wärmeplanstellung die Startpositionen aufzeigen. Überprüfen Sie die einheitliche Abdeckung über die vorgesehene Verteilung hinweg.
Datenspeicherung und Organisation
Ordnerstruktur
project-name/
raw/
2026-04-12/
episode_001.hdf5
episode_002.hdf5
...
2026-04-13/
episode_101.hdf5
...
validated/
episode_001.hdf5 # passed QA
episode_002.hdf5
...
rejected/
episode_045.hdf5 # failed QA, kept for reference
...
metadata/
collection_log.csv # operator, date, start_state, duration, QA status
camera_calibration_2026-04-12.json
task_specification.md
training/
train/ # 85-90% of validated episodes
val/ # 10-15% of validated episodes
Namensgebende Kongresse
- Episodendateien:
T6 (z.B. T7 ). - In die HDF5-Dateiattribute enthalten Sie Metadaten: Operator-ID, Datumsammlung, Startstatusbeschreibung, QA-Status, Aufgabenname.
- Wenn Sie Episode 45 löschen, ist die nächste Episode immer noch 46, nicht 45.
Sicherungssysteme
- Täglich: Synchronisieren Sie die Roh- oder Verzeichnis auf eine externe SSD oder NAS.
- Wochenlich: Laden Sie das validierte Verzeichnis/Verzeichnis in den Cloud-Speicher (AWS S3, Google Cloud Storage) hoch.
- Nach jeder Sammelkampagne: Erstellen Sie ein versionisiertes Archiv (z.B.
T8 ) und laden Sie es in den gemeinsamen Speicher Ihres Teams hoch. - Wenn Sie Daten ändern müssen (z.B. Ernteepisoden, Zeitstempel beheben), erstellen Sie eine neue Datei und halten Sie die Originaldatei in Roh/.
Aufladen in die Ausbildungspiebel
LeRobot-Eingestion
Um Ihren HDF5-Datenbestand in LeRobot-Format für die Ausbildung mit ACT oder Diffusion Policy umzuwandeln:
# Convert HDF5 episodes to LeRobot Parquet format
python -m lerobot.scripts.convert_dataset \
--raw-dir ./validated/ \
--repo-id my-org/my-task-v1 \
--raw-format hdf5_aloha
# Verify the converted dataset
python -m lerobot.scripts.visualize_dataset \
--repo-id my-org/my-task-v1 \
--episode-index 0
Überprüfung der Strukturen des HDF5
Vor dem Umwandeln überprüfen Sie, ob Ihre HDF5-Dateien die erwartete Struktur enthalten:
# Quick verification script
import h5py
import numpy as np
with h5py.File('episode_0001.hdf5', 'r') as f:
# Check required fields
assert 'observations' in f
assert 'action' in f
qpos = f['observations/qpos'][:]
images = f['observations/images/cam_high'][:]
actions = f['action'][:]
print(f"Joint data: {qpos.shape}") # expect (T, num_joints)
print(f"Images: {images.shape}") # expect (T_img, H, W, 3)
print(f"Actions: {actions.shape}") # expect (T, num_joints)
# Check for NaN values
assert not np.any(np.isnan(qpos)), "NaN in joint data!"
assert not np.any(np.isnan(actions)), "NaN in actions!"
# Check timestamp monotonicity
if 'timestamps' in f:
ts = f['timestamps'][:]
assert np.all(np.diff(ts) > 0), "Non-monotonic timestamps!"
Für detaillierte Format-Spezifikationen und Konvertierung zwischen HDF5, RLDS und LeRobot-Formaten siehe unseren Datenformat-Leitfaden.
Benötigen Sie Hilfe bei der Datenerhebung?
RCSV verwaltet den gesamten Datenerfassungsprozess
[Schauen Sie die Datenerhebungssysteme]







