Echtzeitroboter-Inferenz: Edge vs. Cloud-Architektur Tradeoffs
Wenn man die Robotern bei der Rand-Verglichenung mit der Cloud-Politik abschließen soll <unk> Latenzanalyse, Hardware-Optionen, Modellquantifizierung und Kostenvergleich.
[← Forschung]
Die Ableitungsarchitektur für Ihre Roboterpolitik bestimmt, welche Modelle Sie ausführen können, zu welchem Preis, mit welcher Latenz garantiert.
Latenzanforderungen nach Aufgabenart
Bevor Sie eine Ableitungsarchitektur wählen, benötigen Sie eine genaue Latenzanforderung für Ihre Aufgabe.
- Frei-Raum-Bewegung (Arm bewegt sich zu einem Ziel): 50
100 ms Ableitungs-Latenz ist akzeptabel. Der Arm bewegt sich während der Anflugphasen mit geringer Geschwindigkeit, und eine 100-ms-Stall-Politikfrage verursacht keine Positionierungsfehler über der Aufgabenverträglichkeit. - ** Kontaktreiche Manipulation (Einsetzen, Montage):** 10
20 ms Ableitlatenz erforderlich. Im Moment des Kontakts können kleine Zustandsänderungen (0,5 1 mm Positionsfehler) zu Aufgabenfehlern führen, und die Richtlinie muss häufig erneut anfragen, um auf der Verteilung zu bleiben. - Reaktive Festnahme (bewegendes Objekt, Transportmittel): < 50 ms erforderlich. Die Position des Objektes ändert sich zwischen den Anfragen nach Richtlinien; veraltete Anfragen führen zu systematischen Fehlfällen.
- Sicherheitskritische Stopp: < 1 ms. Dies kann nicht von der Richtlinien-Entschlussschleife abhängen
es muss von einem speziellen Sicherheitscontroller auf dem Roboter behandelt werden.
Rand-Hardware-Optionen
Die Edge-Inferenz-Hardware läuft mit dem Roboter zusammen, wodurch die Netzwerk-Rund-Trip-Latenz beseitigt wird.
| Hardware | TOPS (INT8) | Price | Power | Form Factor | Best For |
|---|---|---|---|---|---|
| NVIDIA Jetson AGX Orin 64GB | 275 TOPS | $499 (module) | 15–60W | Embedded module | Full policy inference at edge |
| NVIDIA Jetson Orin NX 16GB | 100 TOPS | $299 (module) | 10–25W | Embedded module | Smaller models, power-constrained |
| NVIDIA RTX 4090 (workstation) | ~1,600 TOPS (FP16) | $1,600 | 450W TDP | Desktop PCIe | Large model inference, multiple robots |
| Intel NUC with Arc GPU | ~40 TOPS | $600–$900 | 35W | Mini PC | Simple BC policies, low cost |
| Raspberry Pi 5 | ~5 TOPS | $80 | 5–10W | SBC | MLP policies only, very simple tasks |
Für die meisten Manipulationsarbeiten, die ACT oder Diffusionspolitik betreiben, ist die NVIDIA Jetson AGX Orin die bevorzugte Edge-Hardware.
Modellgröße vs. Inferenz-Latenz
| Model | Parameters | Edge (Jetson AGX) | Cloud (A100) | Quantized INT8 Edge |
|---|---|---|---|---|
| BC (MLP policy) | ~1M | 1–3 ms | <1 ms | 1–2 ms |
| ACT (original) | ~84M | 50–100 ms | 15–30 ms | 20–50 ms (FP16) |
| Diffusion Policy (U-Net) | ~100M | 30–80 ms | 10–30 ms | 20–50 ms |
| Diffusion Policy (Transformer) | ~300M | 200–500 ms | 80–200 ms | 100–250 ms |
| OpenVLA (7B) | 7B | 3–10 s | 200–500 ms | 1–3 s (INT4) |
| Octo (93M) | 93M | 30–100 ms | 15–40 ms | 20–60 ms |
Quantifizierungsstrategien
Die Quantifizierung reduziert die Modellpräzision, um den Speicher-Fussdruck zu reduzieren und die Ableitgeschwindigkeit zu erhöhen, was die Genauigkeit kostet:
- FP32 → FP16 (Halbpräzision): 2x Speicherreduktion, <1
3% Genauigkeitsverlust auf den meisten Manipulationsmodellen. Nativ unterstützt auf allen NVIDIA-GPUs seit Pascal. Als Standard für Edge-Entwicklung empfohlen. - FP16 → INT8: Weitere 2x Speicherreduktion, 10
15% Genauigkeitsverlust typisch für Manipulationsrichtlinien. Akzeptabel für L1 L2-Aufgaben; sorgfältig testen für L3+-Genauigkeitsaufgaben. NVIDIA TensorRT für Jetson-optimierte INT8-Entscheidung verwenden. - FP16 → INT4 (4-Bit): 4x Reduktion gegenüber FP16. 15
25% Genauigkeitsverlust. Vor allem nützlich für LLM-basierte Modelle (OpenVLA), wo die Spinback-Sprache die meisten Parameter repräsentiert. - TensorRT-Optimierung: Neben der Quantifizierung verschmilzt TensorRT die Operationen, optimiert das Speicherlayout und kompilliert zu optimierten CUDA-Kerneln für die Ziel-Jetson-Hardware.
Cloud-Inferenz: Wenn es akzeptabel ist
Die Cloud-Förderung ist für spezifische Anwendungsfälle, in denen eine Latenzverträglichkeit besteht, praktikabel:
- Politikenauswahl / Aufgabenplanung: Ein Hochrangiger Planer, der auswählt, welche Low-Level-Fähigkeiten als nächstes ausgeführt werden sollen, kann 500 ms
2s-Latenz tolerieren. Dies ist ein natürliches Split-Point: VLM-basierte Planung in der Cloud ausführen, Low-Level-Fähigkeiten am Rande ausführen. - Szenenverständnis: Semantische Szenenanalyse (Objektklassifizierung, Angebotsschätzung) für die Vor-Graps-Planung kann in der Cloud ausgeführt werden, wenn der Roboter vor Beginn der Manipulation pausiert.
- ** Nicht-Echtzeit-Teleoperationsüberwachung:** Ein cloudbasiertes Überwachungssystem, das den Betrieb von Robotern beobachtet und Anomalien (ohne direkte Kontrolle) erkennt, toleriert jede Latenz.
Kostenvergleich: 1-jährige TCO
| Approach | Upfront | Ongoing/Year | 1-Year TCO | Notes |
|---|---|---|---|---|
| Jetson AGX Orin (1 robot) | $500–$800 | $0 (owned) | $800 | Carrier board adds $200–400 |
| RTX 4090 workstation (5 robots) | $3,000 | $0 (owned) | $3,000 | $600/robot amortized over 1 year |
| Cloud GPU (A100, on-demand) | $0 | $2,200–$4,400 | $2,200–$4,400 | $0.25–$0.50/hr × 8,760 hr (24/7) |
| Cloud GPU (reserved instance) | $0 | $800–$1,600 | $800–$1,600 | ~50% discount for 1-year reservation |
| Jetson + cloud hybrid | $500–$800 | $400–$800 | $900–$1,600 | Edge for real-time, cloud for training |
Die Cloud gewinnt bei Entwicklungs- und Feintuningzyklen, bei denen die GPU-Nutzung <40% (on-demand-Pricing) beträgt. Ein hybrider Ansatz
Die RCSV Plattform bietet einen Cloud-Forschungsendpunkt für Entwicklung und Bewertung, mit einer Rand-Deployment-Verpackung (TensorRT, Jetson) für die Produktion.
Edge und Cloud-Inferenz für Roboter-Politiken
RCSV bietet eine Politikbildung, Edge-Deployment-Verpackung (TensorRT/Jetson) und Cloud-Forschungs-Endpunkte für die Entwicklung.







