Research(으)로 돌아가기

실시간 로봇 인퍼런스: 엣지 vs 클라우드 아키텍처 트레이드오프

언제 엣지 vs 클라우드에서 로봇 정책 추론을 실행해야 <unk> 지연성 분석, 하드웨어 옵션, 모델 양자화 및 비용 비교.

[← 연구]

로봇 정책의 추론 구조는 어떤 모델을 실행할 수 있고, 어떤 비용으로, 어떤 지연률을 보장할 수 있는지 결정합니다.

작업 유형에 따라 지연 요구 사항

추론 아키텍처를 선택하기 전에, 작업에 대한 정확한 지연 요구 사항이 필요합니다. 필요한 지연은 로봇의 제어 주파수와 조작의 성격에 의해 설정됩니다.

  • ** 자유 공간 이동 (목적로 이동하는 팔):** 50100 ms 추론 지연은 허용된다. 접근 단계 동안 팔은 낮은 속도로 이동하며, 100 ms 스태일 정책 쿼리는 작업 용납량 이상에서의 위치 오류를 발생시키지 않는다.
  • ** 접촉 부가한 조작 ( 삽입, 조립):** 1020 ms 추론 지연이 요구된다. 접촉 시, 작은 상태 변화 (0.51 mm 위치 오류) 는 작업 실패를 유발할 수 있으며, 정책은 배포에 유지하기 위해 자주 다시 요청해야합니다.
  • ** 반응형 포착 (운동물, 컨베이어):** <50 ms가 요구된다. 정책 쿼리 사이에 객체 위치가 변하고 있다.
  • ** 안전 비중적 중지:** <1 ms. 이것은 정책 추론 루프에 전혀 의존할 수 없습니다.

엣지 하드웨어 옵션

가장자리 추론 하드웨어는 로봇과 함께 실행되며 네트워크 회로 지연을 제거합니다. 트레이드업은 더 높은 초기 비용과 지역 유지보수 책임입니다.

Hardware TOPS (INT8) Price Power Form Factor Best For
NVIDIA Jetson AGX Orin 64GB 275 TOPS $499 (module) 15–60W Embedded module Full policy inference at edge
NVIDIA Jetson Orin NX 16GB 100 TOPS $299 (module) 10–25W Embedded module Smaller models, power-constrained
NVIDIA RTX 4090 (workstation) ~1,600 TOPS (FP16) $1,600 450W TDP Desktop PCIe Large model inference, multiple robots
Intel NUC with Arc GPU ~40 TOPS $600–$900 35W Mini PC Simple BC policies, low cost
Raspberry Pi 5 ~5 TOPS $80 5–10W SBC MLP policies only, very simple tasks

ACT 또는 전파 정책을 실행하는 대부분의 조작 작업에 NVIDIA Jetson AGX Orin는 가장 좋은 가장자리 하드웨어입니다. 275 TOPS INT8 성능은 ACT 추론을 3080 ms에서 처리하고 양자화 전파는 2050 ms에서 처리합니다.

모델 크기와 인퍼런스 레이텐스

Model Parameters Edge (Jetson AGX) Cloud (A100) Quantized INT8 Edge
BC (MLP policy) ~1M 1–3 ms <1 ms 1–2 ms
ACT (original) ~84M 50–100 ms 15–30 ms 20–50 ms (FP16)
Diffusion Policy (U-Net) ~100M 30–80 ms 10–30 ms 20–50 ms
Diffusion Policy (Transformer) ~300M 200–500 ms 80–200 ms 100–250 ms
OpenVLA (7B) 7B 3–10 s 200–500 ms 1–3 s (INT4)
Octo (93M) 93M 30–100 ms 15–40 ms 20–60 ms

양분화 전략

양자화는 메모리 발자국을 줄이고 추론 속도를 높이기 위해 모델 정확성을 감소시킵니다.

  • FP32 → FP16 (반 정확): 2x 메모리 감소, 대부분의 조작 모델에서 정확성 손실 <13% . 파스칼 이후 모든 NVIDIA GPU에서 원산적으로 지원됩니다. 가장자리 배포의 기본으로 권장됩니다.
  • FP16 → INT8: 추가 2x 메모리 감소, 조작 정책에 전형적인 정확성 손실 1015%. L1L2 작업에 용납할 수 있습니다. L3+ 정확성 작업에 대해 신중하게 테스트합니다. Jetson 최적화된 INT8 추론을 위해 NVIDIA TensorRT를 사용합니다.
  • FP16 → INT4 (4비트): 4× 감소 대 FP16. 1525% 정확성 손실. 주로 언어 척추가 대부분의 매개 변수를 나타내는 LLM 기반 모델 (OpenVLA) 에 유용합니다. 비트와 바이트 (NF4 형식) 또는 GPTQ를 사용하십시오.
  • TensorRT 최적화: 소RT은 양자화 외에도 동작을 통합하고 메모리 레이아웃을 최적화하고 목표 제트슨 하드웨어에 최적화된 CUDA 커널로 컴파일한다. convolutional 모델에 FP16 양자화에 추가로 24x 가속을 제공합니다.

클라우드 인퍼런스: 용납할 때

클라우드 추론은 지연 용량이 있는 특정 사용 사례에 적합합니다.

  • ** 정책 선택 / 작업 계획:** 다음으로 실행할 낮은 수준의 기술을 선택하는 고 수준의 계획자는 500 ms2s 지연을 견딜 수 있습니다. 이것은 자연스러운 분할 포인트입니다. 클라우드에서 VLM 기반의 계획을 실행하고 가장자리에 낮은 수준의 기술을 실행합니다.
  • ** 장면 이해:** 사물 분류, 가격 추정) 의 의미적 장면 분석은 로봇이 조작을 시작하기 전에 멈추면 클라우드에서 실행될 수 있습니다.
  • 실제 시간 아닌 텔레오퍼레이션 모니터링: 로봇의 동작을 감시하고 기호적 기호를 표시하는 클라우드 기반 모니터링 시스템은 (직접 통제를 받지 않고) 모든 지연을 용납합니다.

비용 비교: 1년 TCO

Approach Upfront Ongoing/Year 1-Year TCO Notes
Jetson AGX Orin (1 robot) $500–$800 $0 (owned) $800 Carrier board adds $200–400
RTX 4090 workstation (5 robots) $3,000 $0 (owned) $3,000 $600/robot amortized over 1 year
Cloud GPU (A100, on-demand) $0 $2,200–$4,400 $2,200–$4,400 $0.25–$0.50/hr × 8,760 hr (24/7)
Cloud GPU (reserved instance) $0 $800–$1,600 $800–$1,600 ~50% discount for 1-year reservation
Jetson + cloud hybrid $500–$800 $400–$800 $900–$1,600 Edge for real-time, cloud for training

엣지 하드웨어는 24/7 운영에 결정적으로 승리합니다. 엣지 하드웨어는 개발 및 정렬 주기에 승리합니다. GPU 활용도가 <40% (부상 가격) 이다. 하이브리드 접근 방식은 생산 추론에 가장자리, 주기적인 재교육에 대한 클라우드는 둘 중 가장 좋은 것을 제공합니다.

RCSV 플랫폼 는 개발 및 평가에 대한 클라우드 추론 최종점을 제공하며, 생산에 대한 가장자리 배포 패키지 (TensorRT, Jetson) 를 제공합니다.

로봇 정책에 대한 가장자리와 클라우드 인퍼런스

RCSV는 정책 교육, 가장자리 배포 패키지 (TensorRT/Jetson) 및 개발용 클라우드 추론 최종점을 제공합니다. 훈련된 정책을 한 단계로 생산에 배포하십시오.

[플랫폼을 탐험해 보세요]