Zurück zu Guides

Fernbetriebsbewirtschaftung der Roboterflotte: Überwachung, Diagnose und Betrieb

Wie man Roboter in der Ferne verwaltet <unk> Telemetrie, OTA-Updates, Remote-Access, Incident-Reaktion und KPI-Tracking.

[← Führer]

Ein praktischer Betriebsleitfaden für Teams, die 5 bis 500 Roboter auf mehreren Standorten betreiben der den gesamten Stapel von Telemetrie bis zu OTA-Updates abdeckt.

Komponenten der Flottenmanagementstapelle

Ein Produktions-Flotte-Management-System hat fünf wesentliche Komponenten. Die meisten Teams bauen diese in Schritt um Schritt Beginnen mit Telemetrie und Fernzugriff, dann fügen Sie das Update-System und Alarm, wenn die Flotte über 10 Roboter schwächt.

  • Geräte-Register: Eine Datenbank von jedem Roboter in der Flotte Seriennummer, Modell, Firmware-Version, Standort, zugeordneter Operator und aktueller Status. Dies ist die Quelle der Wahrheit für alle anderen Systeme. Eine einfache PostgreSQL-Tabelle funktioniert; speziell entwickelte Lösungen wie AWS IoT oder Azure IoT Hub bieten dies in Skala.
  • Telemetrie-Pipeline: Streaming von Metriken von Roboter in die Cloud. Typischerweise MQTT oder gRPC vom Roboter, eingesetzt in eine Datenbank mit Zeitreihen (InfluxDB oder TimescaleDB). Ziel <10 Sekunden Latenz für Betriebsmetriken, <1 Sekunde für sicherheitskritische Signale.
  • ** Fernzugriffsschicht:** Authentifizierter Zugriff für Betreiber und Ingenieure zur Inspektion und Steuerung von Roboter ohne physische Präsenz.
  • OTA-Aktualisierungssystem: Mechanismus zur Weitergabe von Firmware, Software und Richtlinienaktualisierungen an Roboter im Feld.
  • Alerten und Aufrufe: Automatische Erkennung von Anomalien mit Eskalation auf Aufrufe-Ingenieure.

Telemetrie zu sammeln

Die Kommission hat die Kommission mit der Einführung eines neuen Systems zur Erreichung der Ziele der Richtlinie über die Überwachung der Umwelt und der Umwelt in den Mitgliedstaaten beschlossen.

  • **Gelenktemperaturen:**Gelenktemperatur des Motors in °C. Warnung bei 70 °C (Warnung), Notfallstoppe bei 85 °C. Höhere Temperatur ist ein früher Indikator für erhöhte Reibung, drohende Belagerungsschwäche oder überlastete Aufgabenprofile.
  • Gemässene Fehlercodes: Irgendein Fehlercode des Motorfahrers, mit Zeitstempel und gemeinsamer ID registriert. Fehlercodes sollten auf menschlich lesbare Beschreibungen in Ihrem Monitoring-Dashboard entschlüsselt werden.
  • Ladezustand und Spannung der Batterie: % Batterie und Spannung mit 1-minütigen Abständen.
  • Task-Erfolgs-/Fehlerrate: Ergebnis pro Episode mit Aufgabenart, Dauer und Fehlmodus.
  • Netzwerklatenz: Rundreise-Latenz vom Roboter zur Cloud mit 30-Sekunden-Intervallen.
  • ** Kameragesundheit:** Bildschraubrate und gefallene Bildschraubzahlen pro Kamera.

Überwachungsinfrastruktur

Der Standard-Open-Source-Monitoring-Stack funktioniert gut für Roboterflotten bis zu ~ 200 Einheiten:

  • Prometheus + Grafana: Prometheus schraubt die von jedem Roboter-Flotte-Agent mit 15-Sekundenintervallen ausgestellten Endpunkte. Grafana visualisiert Dashboards auf Flottenebene: Gesamtbetriebszeit, Gesundheit pro Roboter, Aufgabenübertragungsleistung und Alarmgeschichte.
  • InfluxDB: Für die Hochfrequenz-Telemetrie (gemeinsame Positionen bei 100 Hz) verwenden Sie die Zeitreihenkompression von InfluxDB anstelle von Prometheus (die nicht für hochkardinelle, hochfrequente Daten optimiert ist).
  • PagerDuty: Verwaltet die Aufrufspiegelung und die Aufschwungserhöhung. Integration von Prometheus alertmanager → PagerDuty für die automatisierte Erstellung von Vorfällen.
  • Bildschirm für die Gesundheitsschutz der Fleet: Erstellen Sie in [Plattform] eine einbildliche "Mission Control"-Ansicht mit: Karte aller Roboterstandorte mit Statusindikatoren, Top-5 fehlender Aufgaben, Betriebszeitprozentsatz der Flotte und Roboter, die Wartung benötigen.

Methoden des Fernzugangs

Method Latenz Security Best For
SSH over VPN (WireGuard) 20–80ms depending on VPN server location High — key-based auth, encrypted tunnel Engineering diagnostics, log review, config changes
WebRTC remote desktop 50–150ms Medium — requires signaling server security Operator GUI access, rviz2 visualization
ROS2 bridge (rosbridge_suite) 30–100ms Low by default — add TLS + auth explicitly Programmatic telemetry access, remote monitoring scripts

WireGuard VPN ist die empfohlene Grundlage für den Remote-Zugriff. Ein WireGuard-Server (z.B. auf einem 5 $ / Monat DigitalOcean-Droplet) bereitstellen und jeden Roboter als WireGuard-Client mit einem einzigartigen Schlüsselpaar konfigurieren.

Warnschwellen

Metric Warning Threshold Emergency Threshold Automated Action
Joint temperature >70°C >85°C Emergency: immediate e-stop
Task success rate (7-day rolling) <80% <60% Emergency: suspend policy, alert on-call
Battery SoC <20% <10% Emergency: return to charger or alert operator
Network latency (robot→cloud) >200ms >500ms Warning: log; Emergency: disable teleoperation
Camera frame drop rate >5% >20% Warning: log; Emergency: pause data collection
Consecutive task failures 3 in a row 5 in a row Warning: operator alert; Emergency: suspend + escalate

OTA-Aktualisierungsprozess

Über-die-Luft-Updates sind, wie Sie Verbesserungen und Sicherheits-Fixes zu eingesetzten Robotern ohne Site-Besuche versenden. Ein disziplinierter Update-Prozess verhindert, dass Updates zu Unfällen führen:

  • Build: Jedes Update (Firmware, Software oder Politik) wird in CI eingebaut und erzeugt ein versionertes Artefakt mit einer Schäffersumme von sha256.
  • Stage-Test: Vor jeder Feldverwendung wird das Update auf 23 Stage-Roboter im Labor angewendet und mit einer automatisierten Testsuite von 50 Versuchen validiert.
  • Kanarien-Rollout (10%): Auf 10% der Flotte (oder mindestens 3 Roboter) für 48 Stunden eingesetzt.
  • ** Vollständige Einführung:** Wenn die Kanarischen Kennzahlen nominal sind, setzen Sie die Einführung auf die restliche Flotte aus.
  • Rollback-Fähigkeit: Jeder Roboter behält das Vorbild der vorherigen Version vor Ort. Rollback dauert < 2 Minuten und kann pro Roboter oder in der gesamten Flotte vom Management-Dashboard aus ausgelöst werden.

Fleet-KPI

KPI Definition Target Measurement Interval
MTBF (Mean Time Between Failures) Average operating hours between unplanned stoppages >200 hours Monthly
MTTR (Mean Time to Repair) Average time from incident detection to resumed operation <2 hours Monthly
Fleet uptime % of scheduled operating hours spent in active operation >95% Weekly
Task completion rate % of tasks completed successfully without human intervention >90% Daily
OTA update success rate % of update deployments that succeed without rollback >99% Per-release

Anbindungsoptionen: Detaillierter Vergleich

Option Typical Latenz Bandwidth Cost/Robot/Month Best For
WireGuard VPN over WiFi 20-80 ms 100+ Mbps $5 (VPN server) Lab and warehouse with existing WiFi
WireGuard VPN over 5G 15-40 ms 100-500 Mbps $30-$80 (data plan) Mobile robots, outdoor, no WiFi available
Tailscale (managed WireGuard) 20-80 ms 100+ Mbps $0-$18/device Quick setup, NAT traversal, SSO integration
WebRTC peer-to-peer 50-150 ms 10-50 Mbps $0 (STUN/TURN server) Browser-based remote viewing, video streams
Wired Ethernet (on-premise) <1 ms 1 Gbps $0 (existing infra) Fixed arm installations, highest reliability

Für die meisten Bereitstellungen ist die empfohlene Architektur: Wire-Ethernet für den Roboter LAN (Arm Controller zu Arbeitsplatz), WireGuard VPN für Remote-Zugriff (Ingenieur Laptop zu Roboter) und WiFi oder 5G für Cloud-Telemetrie-Upload. Dies bietet eine Sub-Millisekunden-Latenz für die Steuerungsschleifen und ermöglicht gleichzeitig sicheren Remote-Zugriff.

Fehlererkennung und automatische Wiederherstellung

Ein gut gestaltetes Flottenmanagementsystem erholt sich ohne menschliches Eingreifen von häufigen Fehlern und reduziert den MTTR von Stunden auf Minuten:

  • Hundzeitschalter: Der Bordflottenagent sendet alle 10 Sekunden einen Herzschlag. Wenn der Flottenmanager 30 Sekunden lang keinen Herzschlag erhält, markiert er den Roboter als "unerreichbar" und löst eine Netzwerkdiagnose-Sequenz aus (Ping, Traceroute, DNS-Check).
  • Automatischer Prozessrückstart: Systemd-Service-Einheiten für alle Robotersoftware (ROS2-Lancing, Flottenagent, Kamera-Treiber) verwenden. Konfigureren Sie T0 mit T1. Dies erholt sich automatisch von Prozessstörungen (Sefault, OOM-Todes). Melden Sie jeden Neustartereignis in die Telemetrie-Pipeline.
  • ** Kamerawiederherstellung:** USB-Kameras fallen gelegentlich vom Bus. Der Flottenagent überwacht die T2 Geräteknoten. Wenn eine Kamera verschwindet, läuft der Agent T3 auf dem Port, wartet 3 Sekunden und überprüft, ob die Kamera wieder erscheint. Wenn nicht nach 3 Versuchen, warnen Sie den Betreiber für physische Inspektion.
  • Netzwerk-Fallover: Für Roboter mit sowohl WiFi- als auch Mobilfunkverbindung einrichten Sie automatische Ausfallover: Wenn die WiFi-Latenz für 30 Sekunden 200 ms überschreitet, schalten Sie den Telemetrie- und API-Verkehr auf die Mobilfunksicherung um.
  • Flachraummanagement: HDF5 Datenerfassung kann schnell Aufzeichnungen füllen (3 Kameras bei 30 fps = ~ 50 GB/Stunde). Der Flottenagent überwacht die Festplattennutzung und überträgt automatisch abgeschlossenen Episoden auf das NAS oder den Cloud-Speicher, wenn die Festplatte 70% überschreitet.

Integration der RCSV-Plattform

Die RCSV-Plattform bietet eine verwaltete Flottenmanagement-Schicht, die die Notwendigkeit beseitigt, eine maßgeschneiderte Überwachungsinfrastruktur aufzubauen:

  • Fleet-Dashboard: Echtzeitkarte aller Roboterstandorte mit Statusindikatoren (grün/gelb/rot). Klicken Sie auf jeden Roboter, um Live-Telemetrie, Kamerafeeds und Aufgabenhistorie anzuzeigen.
  • Telemetrie-Pipeline: Roboter senden Metriken über MQTT zum InfluxDB-Backend der Plattform.
  • OTA-Update-Manager: Neue Firmware, Software oder Richtlinienartefakte auf die Plattform hochladen.
  • Alertsrouting: Konfiguration von Alarmregeln (Schwelle- oder Anomalieerkennung) mit der Routing an E-Mail, Slack, PagerDuty oder das integrierte Benachrichtigungssystem der Plattform.

Verwandte Leitfäden

Arbeiten mit RCSV

RCSV bietet eine Flottenmanagementinfrastruktur für die Bereitstellung von Robotern in beliebiger Größe.

  • Datenplattform -- verwaltetes Flotten-Dashboard, Telemetrie, OTA-Updates und Alarm-Routing
  • Reparatur und Wartung -- Ferndiagnose und Vorortdienst für Roboter der Flotte
  • Roboterleasing -- Leasing von flottenfertigen Robotern mit vorinstallierten Flottenmanagement-Agenten
  • [Kontaktieren Sie uns] T15) - eine Überprüfung der Architektur der Flotte für Ihre Einsetzung anfordern

Verwalten Sie Ihre Flotte aus einem Dashboard

Die RCSV-Plattform bietet Flottentelemetrie, OTA-Aktualisierungsmanagement und Fernzugriff für Roboterbetreiber in jedem Maßstab.

[Erforschen Sie die Plattform]