Zurück zu Research

Echtzeitroboter-Inferenz: Edge vs. Cloud-Architektur Tradeoffs

Wenn man die Robotern bei der Rand-Verglichenung mit der Cloud-Politik abschließen soll <unk> Latenzanalyse, Hardware-Optionen, Modellquantifizierung und Kostenvergleich.

[← Forschung]

Die Ableitungsarchitektur für Ihre Roboterpolitik bestimmt, welche Modelle Sie ausführen können, zu welchem Preis, mit welcher Latenz garantiert.

Latenzanforderungen nach Aufgabenart

Bevor Sie eine Ableitungsarchitektur wählen, benötigen Sie eine genaue Latenzanforderung für Ihre Aufgabe.

  • Frei-Raum-Bewegung (Arm bewegt sich zu einem Ziel): 50100 ms Ableitungs-Latenz ist akzeptabel. Der Arm bewegt sich während der Anflugphasen mit geringer Geschwindigkeit, und eine 100-ms-Stall-Politikfrage verursacht keine Positionierungsfehler über der Aufgabenverträglichkeit.
  • ** Kontaktreiche Manipulation (Einsetzen, Montage):** 1020 ms Ableitlatenz erforderlich. Im Moment des Kontakts können kleine Zustandsänderungen (0,51 mm Positionsfehler) zu Aufgabenfehlern führen, und die Richtlinie muss häufig erneut anfragen, um auf der Verteilung zu bleiben.
  • Reaktive Festnahme (bewegendes Objekt, Transportmittel): < 50 ms erforderlich. Die Position des Objektes ändert sich zwischen den Anfragen nach Richtlinien; veraltete Anfragen führen zu systematischen Fehlfällen.
  • Sicherheitskritische Stopp: < 1 ms. Dies kann nicht von der Richtlinien-Entschlussschleife abhängen es muss von einem speziellen Sicherheitscontroller auf dem Roboter behandelt werden.

Rand-Hardware-Optionen

Die Edge-Inferenz-Hardware läuft mit dem Roboter zusammen, wodurch die Netzwerk-Rund-Trip-Latenz beseitigt wird.

Hardware TOPS (INT8) Price Power Form Factor Best For
NVIDIA Jetson AGX Orin 64GB 275 TOPS $499 (module) 15–60W Embedded module Full policy inference at edge
NVIDIA Jetson Orin NX 16GB 100 TOPS $299 (module) 10–25W Embedded module Smaller models, power-constrained
NVIDIA RTX 4090 (workstation) ~1,600 TOPS (FP16) $1,600 450W TDP Desktop PCIe Large model inference, multiple robots
Intel NUC with Arc GPU ~40 TOPS $600–$900 35W Mini PC Simple BC policies, low cost
Raspberry Pi 5 ~5 TOPS $80 5–10W SBC MLP policies only, very simple tasks

Für die meisten Manipulationsarbeiten, die ACT oder Diffusionspolitik betreiben, ist die NVIDIA Jetson AGX Orin die bevorzugte Edge-Hardware.

Modellgröße vs. Inferenz-Latenz

Model Parameters Edge (Jetson AGX) Cloud (A100) Quantized INT8 Edge
BC (MLP policy) ~1M 1–3 ms <1 ms 1–2 ms
ACT (original) ~84M 50–100 ms 15–30 ms 20–50 ms (FP16)
Diffusion Policy (U-Net) ~100M 30–80 ms 10–30 ms 20–50 ms
Diffusion Policy (Transformer) ~300M 200–500 ms 80–200 ms 100–250 ms
OpenVLA (7B) 7B 3–10 s 200–500 ms 1–3 s (INT4)
Octo (93M) 93M 30–100 ms 15–40 ms 20–60 ms

Quantifizierungsstrategien

Die Quantifizierung reduziert die Modellpräzision, um den Speicher-Fussdruck zu reduzieren und die Ableitgeschwindigkeit zu erhöhen, was die Genauigkeit kostet:

  • FP32 → FP16 (Halbpräzision): 2x Speicherreduktion, <13% Genauigkeitsverlust auf den meisten Manipulationsmodellen. Nativ unterstützt auf allen NVIDIA-GPUs seit Pascal. Als Standard für Edge-Entwicklung empfohlen.
  • FP16 → INT8: Weitere 2x Speicherreduktion, 1015% Genauigkeitsverlust typisch für Manipulationsrichtlinien. Akzeptabel für L1L2-Aufgaben; sorgfältig testen für L3+-Genauigkeitsaufgaben. NVIDIA TensorRT für Jetson-optimierte INT8-Entscheidung verwenden.
  • FP16 → INT4 (4-Bit): 4x Reduktion gegenüber FP16. 1525% Genauigkeitsverlust. Vor allem nützlich für LLM-basierte Modelle (OpenVLA), wo die Spinback-Sprache die meisten Parameter repräsentiert.
  • TensorRT-Optimierung: Neben der Quantifizierung verschmilzt TensorRT die Operationen, optimiert das Speicherlayout und kompilliert zu optimierten CUDA-Kerneln für die Ziel-Jetson-Hardware.

Cloud-Inferenz: Wenn es akzeptabel ist

Die Cloud-Förderung ist für spezifische Anwendungsfälle, in denen eine Latenzverträglichkeit besteht, praktikabel:

  • Politikenauswahl / Aufgabenplanung: Ein Hochrangiger Planer, der auswählt, welche Low-Level-Fähigkeiten als nächstes ausgeführt werden sollen, kann 500 ms2s-Latenz tolerieren. Dies ist ein natürliches Split-Point: VLM-basierte Planung in der Cloud ausführen, Low-Level-Fähigkeiten am Rande ausführen.
  • Szenenverständnis: Semantische Szenenanalyse (Objektklassifizierung, Angebotsschätzung) für die Vor-Graps-Planung kann in der Cloud ausgeführt werden, wenn der Roboter vor Beginn der Manipulation pausiert.
  • ** Nicht-Echtzeit-Teleoperationsüberwachung:** Ein cloudbasiertes Überwachungssystem, das den Betrieb von Robotern beobachtet und Anomalien (ohne direkte Kontrolle) erkennt, toleriert jede Latenz.

Kostenvergleich: 1-jährige TCO

Approach Upfront Ongoing/Year 1-Year TCO Notes
Jetson AGX Orin (1 robot) $500–$800 $0 (owned) $800 Carrier board adds $200–400
RTX 4090 workstation (5 robots) $3,000 $0 (owned) $3,000 $600/robot amortized over 1 year
Cloud GPU (A100, on-demand) $0 $2,200–$4,400 $2,200–$4,400 $0.25–$0.50/hr × 8,760 hr (24/7)
Cloud GPU (reserved instance) $0 $800–$1,600 $800–$1,600 ~50% discount for 1-year reservation
Jetson + cloud hybrid $500–$800 $400–$800 $900–$1,600 Edge for real-time, cloud for training

Die Cloud gewinnt bei Entwicklungs- und Feintuningzyklen, bei denen die GPU-Nutzung <40% (on-demand-Pricing) beträgt. Ein hybrider Ansatz Edge für Produktionsnachfolgerungen, Cloud für periodische Re-Training bietet das Beste beides.

Die RCSV Plattform bietet einen Cloud-Forschungsendpunkt für Entwicklung und Bewertung, mit einer Rand-Deployment-Verpackung (TensorRT, Jetson) für die Produktion.

Edge und Cloud-Inferenz für Roboter-Politiken

RCSV bietet eine Politikbildung, Edge-Deployment-Verpackung (TensorRT/Jetson) und Cloud-Forschungs-Endpunkte für die Entwicklung.

Erforschen Sie die Plattform →