Roboterzeit: Warum zeitliche Ausrichtung der versteckte Engpässe im Roboternutzen ist
Die Zeitverschiebung zwischen Kameras, Gelenkständen und Motorkommandos beschädigt die Demonstration von Robotern als strukturiertes Etikettgeräusch.
[← Forschung]
Die Roboter-Lerngemeinschaft schafft Demonstrationen, aber die meisten dieser Daten sind temporär kontaminiert
1
der zeitlichen Fehlinterrichtung = 2
Das Problem: Zeitliche Fehlinformation als strukturiertes Etikettgeräusch
Bei der Verhaltensklonung soll jede Trainingsprobe ein Paar (ot, at) sein.
Dies ist kein zufälliger Lärm. Es ist ein strukturierter Etikettlärm, der mit dem physischen Zustand des Systems korreliert. Die Größe der zeitlichen Fehlinterrichtung wächst mit der Endefektorgeschwindigkeit, ändert sich bei den Kontaktübergängen, variiert mit der Steuerungsfrequenz und hängt von der Kamera-Expositionszeit ab. Während der genauen Momente, die für das politische Lernen am wichtigsten sind
Die Arithmetik ist einfach. Bei 30 fps beträgt ein Offset-Frame 33 ms. Ein mit 0,5 m/s beweger Roboterarm verdrängt 16,5 mm pro Frame. Für Präzisionsmanipulationsaufgaben
Systeme, die in der Forschungsgemeinschaft weit verbreitet werden
Warum Zeitstempeln nicht reparieren
Die Instinkte reagiert darauf, alles zu zeitmarken. Die meisten Sammelkodebasen rufen
Die Zeitstempel auf der Hostseite messen, wann das Betriebssystem die Daten empfangen hat, nicht wenn das physische Ereignis stattgefunden hat. Zwischen dem Foton, der den Sensor trifft und dem zeitlichen Stempel, der aufgezeichnet wird, kommen mehrere Quellen für variablen Verzögerungen auf:
- ** USB-Umfrage-Latenz:** USB 2.0-Umfragen mit 1 ms-Intervallen; USB 3.0 mit 125 μs. Aber der tatsächliche Transfer wird vom Host-Controller geplant und kann durch Bus-Konflikt verzögert werden.
- ** OS-Scheduling:** Der Kernel schlägt den USB-Interrupt-Handler und dann den UserSpace-Callback. Auf einem nicht-RT-Linux-Kernel unter Last reicht der Scheduling jitter von 1
50 ms. Ein Python-Prozess fügt GIL-Konflikt oben hinzu. - ** Kamera rollende Verschluss:** Ein Rollende Verschluss-Sensor zeigt die oberen und unteren Reihen zu verschiedenen Zeiten, in der Regel über 15
33 ms. Das "Zeitstempel" des Rahmens ist zweideutig das Bild ist ein zeitlicher Schmutz, kein Momentaufnahme. - Netzwerkpufferung: Wenn Sensoren über Ethernet kommunizieren (RealSense über USB, ROS-Themen über DDS, EtherCAT-Motorantrieb), fügt das Netzwerkstackpufferung eine weitere variable Verzögerungsschicht hinzu.
- Gemeinsame Buss-Latenz: CAN-Buss, serieller UART und EtherCAT haben jeweils ihre eigenen Leselatenzen. CAN-Buss bei 1 Mbps mit 8 Gelenken führt zu ~ 1 ms Serialisierungsverzögerung; serieller UART bei 115200 Baud ist schlimmer. Die gemeinsamen Zustände werden sequentiell gelesen, so dass Gelenk 1 und Gelenk 6 nicht einmal gleichzeitig sind.
Diese Verzögerungen sind individuell klein, aber kollektiv variabel. Schlimmer noch, sie sind nicht konstant
Die vier Schichten der zeitlichen Ausrichtung von Robotern
Die Zeitbereinigung muss vier verschiedene Schichten angehen, die jeweils auf dem unteren Baustein aufbauen.
4
Datensatzzertifizierung
Die Zeitung ist unsicher, das histogramm ist nervös, die Karte ist abgelaufen, jeder Datensatz wird mit einem Zeitraumgesundheitsbericht versandt, damit die Verbraucher wissen, was sie trainieren.
3
Sensor-Aktüator Bindung
Kamera-Rahmen
2 .
Auslöser für Hardware
Globale Verschlusskameras mit externen Auslöserlinien, synchronisierte Ausstrahlung über alle Sichtpunkte, keine Rollschutzbläschen, keine frei laufenden Rahmenuhren, die sich auseinander treiben.
1
Uhr-Synchronisierung
PTP (IEEE 1588) oder gemeinsame Uhrquellen auf allen Geräten. Jeder Sensor, jeder Akteur und jeder Rechenknoten stimmen zu, wie viel Zeit es innerhalb von Mikrosekunden, nicht Millisekunden ist.
Die meisten Roboter-Lern-Setups implementieren keine dieser Schichten. Manche implementieren Schicht 1 teilweise (NTP, nicht PTP). Fast keine implementieren Schichten 2
RCSV-Ansatz: Hardware-basierte temporäre Infrastruktur
Die Datenverwertungsinfrastruktur des RCSV implementiert alle vier Ebenen der zeitlichen Ausrichtung standardmäßig und nicht als Add-on.
- <5 ms Synchronisierung über alle Streams. Hardware-ausgelöst globale Verschlusskameras schießen auf der gleichen Auslöserlinie wie gemeinsame Zustand-Wiedergabe.
- LED + PRBS-Phasen-Decodierung für die wahre Erfassung Verzögerung Messung. Ein LED-Array, angetrieben durch eine pseudo-random binäre Sequenz (PRBS) ist im Bildfeld der Kamera sichtbar. Durch die Decodierung des PRBS-Musters im erfassten Bild, messen wir die tatsächliche End-zu-End-Verzögerung von Trigger bis Pixel-Erfassung
einschließlich jeder Pipeline-Latenz, die die Kamera-Firmware einführt. Dies ist kein Kalibrierungsschritt; es läuft kontinuierlich. - Zeitbezogene Gesundheitsmessungen für jeden Datensatz. Jeder von RCSV bereitgestellte Datensatz enthält einen Zeitbericht pro Episode: max. jitter, mittlere Synchronisierungsverschiebung, abgestürzte Bilderzahl und ein vollständiges jitter-Histogramm.
- Ergebnis: 2
3x weniger Demonstrationen benötigt werden. Bei gleichwertigen Aufgaben (Pick-place, Pegel-Einsetzung, Kabel-Routing) erreichen die auf hardware-synchronisierten RCSV-Daten ausgebildeten Richtlinien gleichwertige Erfolgsraten mit 23x weniger Demonstrationen im Vergleich zur gleichen Aufgabe, die mit software-timestampelten USB-Kamera-Setups gesammelt wird. Die Demonstrationen sind nicht besser, weil die Betreiber besser sind sie sind besser, weil jedes Beobachtungs-Aktionspaar tatsächlich dem gleichen physischen Moment entspricht.
Verwandte Arbeit
Die zeitliche Kalibrierung hat eine lange Geschichte in Multi-Sensor-Systemen, obwohl sie überraschend wenig Aufmerksamkeit in der Roboter-Lern-Daten-Sammlung-Community speziell erhalten hat:
- **Furgale et al., "Unified Temporal and Spatial Kalibrierung for Multi-Sensor Systems" (IROS 2013) **
Das Kalibr-Framework führte eine gemeinsame Temporal- und Raumkalibration für Kamera-IMU-Systeme ein. - Qin & Shen, "Online Temporal Kalibrierung for Monocular Visual-Inertial Systems" (2018)
Zeigte, dass die Zeitkompensation der Kamera-IMU während des VIO-Betriebs online geschätzt werden kann, wodurch die Notwendigkeit einer Offline-Kalibrierung beseitigt wird. - **Tschopp et al., "VersaVIS: Eine offene, vielseitige Multi-Camera Visual-Inertial Sensor Suite" (2019) **
Hardware-ausgelöstes Multi-Camera + IMU-System mit Sub-Millisekunden-Synchronisierung. Der nächstgelegene Vorläufer für das, was Roboter-Lerndaten-Sammeln benötigt, entwickelt für SLAM anstatt Manipulation. - **Zhao et al., "Learning Fine-Grained Bimanuelles Manipulieren with Low-Cost Hardware" (2023) **
Das ALOHA-System verwendet Software-Zeitstempel über USB-Kameras und Dynamixel-Seriebusse hinweg. - **Khazatsky et al., "DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset" (2024) **
76K Episoden in 564 Szenen. RealSense-Kameras mit Host-Seite-Zeitstempeln verwenden. Die zeitliche Ausrichtung über die verteilten Sammelstandorte ist nicht standardisiert. - **Chi et al., "Universal Manipulation Interface" (2024) **
UMI verwendet GoPro-Kameras mit SLAM-basierter Posenbewertung und interpolierten Aktionsetiketten. Der Interpolierungsschritt verringert die zeitliche Fehlinterrichtung implicit, beseitigt sie aber nicht. - **F2F-AP: "Flow-to-Future Asynchronous Policy" (2026)
Proposes learned compensation for asynchronous observation-action streams. Demonstrate, dass selbst algorithmische Ansätze von der Kenntnis der Grundwahrheit profitieren, die die Verteilung der Schulungsdaten ausgleicht.
Was ist als Nächstes: SyncBench
RCSV entwickelt einen Benchmark, der direkt misst, wie sich zeitliche Ausrichtungssysteme auf die Politikleistung auswirken.
- Gleicher Aufgabe, gleiche Richtlinienarchitektur, unterschiedliche Zeitungen. Drei Bedingungen: (1) nur Softwarezeitstempel, (2) Hardware-ausgelöst Kameras ohne vollständige Synchronisierung, (3) vollständige vier-Schicht-Zeit-Ausrichtung wie oben beschrieben.
- Aufgabenspektrum. Von temporärer Verzeihung (Bin-Picking, Blockstack) bis temporärer Anspruch (Pig-Einsetzung bei einer Toleranz von 0,5 mm, Kabel-Dreh, USB-Verbindungspartner).
- Metriken. Voraussetzung: jitterverteilung (p50/p95/p99), politische Erfolgsrate bei 50/100/200/500 Demonstrationen, Mindestdemonstrationen, um 80% Erfolg zu erreichen, und Ausfallmodus-Abbruch (Überschuss, Kontaktverlust, Greifschuss, Kollision).
Wir erwarten, dass SyncBench zeigt, dass zeitliche Ausrichtung ein stärkerer Prädiktor für die Probeeffizienz ist als Architekturwahl für kontaktreiche Aufgaben.
Hardware-synchronisierte Datenerfassung
RCSV liefert zeitlich ausgerichtete Demonstrationsdaten mit einer zeitlichen Zertifizierung pro Probe.
[Sprich mit unserem Team] [T3







