실시간 로봇 인퍼런스: 엣지 vs 클라우드 아키텍처 트레이드오프
언제 엣지 vs 클라우드에서 로봇 정책 추론을 실행해야 <unk> 지연성 분석, 하드웨어 옵션, 모델 양자화 및 비용 비교.
[← 연구]
로봇 정책의 추론 구조는 어떤 모델을 실행할 수 있고, 어떤 비용으로, 어떤 지연률을 보장할 수 있는지 결정합니다.
작업 유형에 따라 지연 요구 사항
추론 아키텍처를 선택하기 전에, 작업에 대한 정확한 지연 요구 사항이 필요합니다. 필요한 지연은 로봇의 제어 주파수와 조작의 성격에 의해 설정됩니다.
- ** 자유 공간 이동 (목적로 이동하는 팔):** 50
100 ms 추론 지연은 허용된다. 접근 단계 동안 팔은 낮은 속도로 이동하며, 100 ms 스태일 정책 쿼리는 작업 용납량 이상에서의 위치 오류를 발생시키지 않는다. - ** 접촉 부가한 조작 ( 삽입, 조립):** 10
20 ms 추론 지연이 요구된다. 접촉 시, 작은 상태 변화 (0.5 1 mm 위치 오류) 는 작업 실패를 유발할 수 있으며, 정책은 배포에 유지하기 위해 자주 다시 요청해야합니다. - ** 반응형 포착 (운동물, 컨베이어):** <50 ms가 요구된다. 정책 쿼리 사이에 객체 위치가 변하고 있다.
- ** 안전 비중적 중지:** <1 ms. 이것은 정책 추론 루프에 전혀 의존할 수 없습니다.
엣지 하드웨어 옵션
가장자리 추론 하드웨어는 로봇과 함께 실행되며 네트워크 회로 지연을 제거합니다. 트레이드업은 더 높은 초기 비용과 지역 유지보수 책임입니다.
| Hardware | TOPS (INT8) | Price | Power | Form Factor | Best For |
|---|---|---|---|---|---|
| NVIDIA Jetson AGX Orin 64GB | 275 TOPS | $499 (module) | 15–60W | Embedded module | Full policy inference at edge |
| NVIDIA Jetson Orin NX 16GB | 100 TOPS | $299 (module) | 10–25W | Embedded module | Smaller models, power-constrained |
| NVIDIA RTX 4090 (workstation) | ~1,600 TOPS (FP16) | $1,600 | 450W TDP | Desktop PCIe | Large model inference, multiple robots |
| Intel NUC with Arc GPU | ~40 TOPS | $600–$900 | 35W | Mini PC | Simple BC policies, low cost |
| Raspberry Pi 5 | ~5 TOPS | $80 | 5–10W | SBC | MLP policies only, very simple tasks |
ACT 또는 전파 정책을 실행하는 대부분의 조작 작업에 NVIDIA Jetson AGX Orin는 가장 좋은 가장자리 하드웨어입니다. 275 TOPS INT8 성능은 ACT 추론을 30
모델 크기와 인퍼런스 레이텐스
| Model | Parameters | Edge (Jetson AGX) | Cloud (A100) | Quantized INT8 Edge |
|---|---|---|---|---|
| BC (MLP policy) | ~1M | 1–3 ms | <1 ms | 1–2 ms |
| ACT (original) | ~84M | 50–100 ms | 15–30 ms | 20–50 ms (FP16) |
| Diffusion Policy (U-Net) | ~100M | 30–80 ms | 10–30 ms | 20–50 ms |
| Diffusion Policy (Transformer) | ~300M | 200–500 ms | 80–200 ms | 100–250 ms |
| OpenVLA (7B) | 7B | 3–10 s | 200–500 ms | 1–3 s (INT4) |
| Octo (93M) | 93M | 30–100 ms | 15–40 ms | 20–60 ms |
양분화 전략
양자화는 메모리 발자국을 줄이고 추론 속도를 높이기 위해 모델 정확성을 감소시킵니다.
- FP32 → FP16 (반 정확): 2x 메모리 감소, 대부분의 조작 모델에서 정확성 손실 <1
3% . 파스칼 이후 모든 NVIDIA GPU에서 원산적으로 지원됩니다. 가장자리 배포의 기본으로 권장됩니다. - FP16 → INT8: 추가 2x 메모리 감소, 조작 정책에 전형적인 정확성 손실 10
15%. L1 L2 작업에 용납할 수 있습니다. L3+ 정확성 작업에 대해 신중하게 테스트합니다. Jetson 최적화된 INT8 추론을 위해 NVIDIA TensorRT를 사용합니다. - FP16 → INT4 (4비트): 4× 감소 대 FP16. 15
25% 정확성 손실. 주로 언어 척추가 대부분의 매개 변수를 나타내는 LLM 기반 모델 (OpenVLA) 에 유용합니다. 비트와 바이트 (NF4 형식) 또는 GPTQ를 사용하십시오. - TensorRT 최적화:
소RT은 양자화 외에도 동작을 통합하고 메모리 레이아웃을 최적화하고 목표 제트슨 하드웨어에 최적화된 CUDA 커널로 컴파일한다. convolutional 모델에 FP16 양자화에 추가로 2 4x 가속을 제공합니다.
클라우드 인퍼런스: 용납할 때
클라우드 추론은 지연 용량이 있는 특정 사용 사례에 적합합니다.
- ** 정책 선택 / 작업 계획:** 다음으로 실행할 낮은 수준의 기술을 선택하는 고 수준의 계획자는 500 ms
2s 지연을 견딜 수 있습니다. 이것은 자연스러운 분할 포인트입니다. 클라우드에서 VLM 기반의 계획을 실행하고 가장자리에 낮은 수준의 기술을 실행합니다. - ** 장면 이해:** 사물 분류, 가격 추정) 의 의미적 장면 분석은 로봇이 조작을 시작하기 전에 멈추면 클라우드에서 실행될 수 있습니다.
- 실제 시간 아닌 텔레오퍼레이션 모니터링: 로봇의 동작을 감시하고 기호적 기호를 표시하는 클라우드 기반 모니터링 시스템은 (직접 통제를 받지 않고) 모든 지연을 용납합니다.
비용 비교: 1년 TCO
| Approach | Upfront | Ongoing/Year | 1-Year TCO | Notes |
|---|---|---|---|---|
| Jetson AGX Orin (1 robot) | $500–$800 | $0 (owned) | $800 | Carrier board adds $200–400 |
| RTX 4090 workstation (5 robots) | $3,000 | $0 (owned) | $3,000 | $600/robot amortized over 1 year |
| Cloud GPU (A100, on-demand) | $0 | $2,200–$4,400 | $2,200–$4,400 | $0.25–$0.50/hr × 8,760 hr (24/7) |
| Cloud GPU (reserved instance) | $0 | $800–$1,600 | $800–$1,600 | ~50% discount for 1-year reservation |
| Jetson + cloud hybrid | $500–$800 | $400–$800 | $900–$1,600 | Edge for real-time, cloud for training |
엣지 하드웨어는 24/7 운영에 결정적으로 승리합니다. 엣지 하드웨어는 개발 및 정렬 주기에 승리합니다. GPU 활용도가 <40% (부상 가격) 이다. 하이브리드 접근 방식은 생산 추론에 가장자리, 주기적인 재교육에 대한 클라우드는 둘 중 가장 좋은 것을 제공합니다.
RCSV 플랫폼 는 개발 및 평가에 대한 클라우드 추론 최종점을 제공하며, 생산에 대한 가장자리 배포 패키지 (TensorRT, Jetson) 를 제공합니다.
로봇 정책에 대한 가장자리와 클라우드 인퍼런스
RCSV는 정책 교육, 가장자리 배포 패키지 (TensorRT/Jetson) 및 개발용 클라우드 추론 최종점을 제공합니다. 훈련된 정책을 한 단계로 생산에 배포하십시오.
[플랫폼을 탐험해 보세요]







