2025 년 클라우드 로봇 아키텍처 패턴
클라우드 연결 로봇 시스템 (cloud-connected robot systems) 의 건축 패턴 <unk> 엣지 추론, 텔레오퍼레이션 스트리밍, 함대 관리 및 데이터 파이프라인
[← 연구]
현대 로봇 시스템은 가장자리, 현장 서버, 클라우드를
클라우드 + 로봇의 이유
클라우드 컴퓨팅의 경제는 물리 로봇에서 멀리 떨어진 상당한 컴퓨팅을 실행하는 것을 실용화했으며, 네트워크 지연성 발전 (5G, WiFi 6E) 은 탈하드를 할 수 있는 것을 확장했습니다. 현대 로봇 배포는 세 단계의 아키텍처를 사용합니다. 안전성 중요한 실시간 제어용 내용 컴퓨팅, 저 지연성 추론 및 로컬 데이터 버퍼링을 위한 엣지 서버, 모델 훈련, 함대 관리 및 텔레오퍼레이션 레일용 클라우드.
핵심 아키텍처 원칙은 다음과 같습니다: _모든 시간적 중요한 것은 로컬에서 실행되며, 컴퓨팅이 많은 모든 것은 클라우드에서 실행됩니다. _ 네트워크 지연이 감소하고 가장자리 하드웨어가 더 강력해질수록 로컬과 클라우드 사이의 경계는 바뀐다.
건축 층
1층: 로봇 탑승
로봇의 탑재 컴퓨터는 안전에 중요한, 어려운 실시간 작업을 수행합니다. 물리적 안전에 영향을 미치는 것은 네트워크 연결에 의존하지 않아야합니다.
- ROS 2 제어 노드: 공동 궤도 실행, 안전 모니터링, 전자 정지 처리. < 1 ms jitter 과 500
1,000 Hz에서 실행되어야 합니다. 결정적인 스케줄링에 필요한 PREEMPT_RT 커널 또는 Xenomai. - ** 안전 제어기:** 공동의 제한 집행, 충돌 모니터링, 작업 공간 경계 검사. 이것은 마지막 방어 라인이며 결코 클라우드에 외부에 할당해서는 안 됩니다.
- ** 지역 상태 추정:** 자기 수용, IMU 합성, 기초 오도메트리.
- ** 하드웨어:** 대부분의 협업 팔에는 내장 컨트롤러 (UR 제어 상자, Franka FCI) 가 포함되어 있습니다. 모바일 로봇을 위해 NVIDIA Jetson AGX Orin (275 TOPS INT8) 는 AI 향상된 인식 및 정책 실행을위한 표준 가장자 모듈입니다.
계층 2: 엣지 서버
로컬 서버 (시설 또는 로봇 방에 위치하고) 는 GPU 가속이 필요한 계산을 처리하지만 ~ 50 ms 지연기보다 낮아야 합니다.
- 정책 추론: ACT, 방전 정책 또는 OpenVLA 정비된 모델을 실행합니다. NVIDIA RTX 4090 또는 A100 서버는 50 Hz에서 5
20 로봇 추론 스트림을 동시에 처리합니다. - ** 지역 데이터 버퍼:** 최근 에피소드 (24
48 시간 운영) 의 링 버퍼, 클라우드 로드 트리프 없이 빠른 검색 및 재훈련을 위한. NVMe RAID는 기록 처리량을 위해 권장됩니다. - ** 실시간 인식:** 객체 탐지, 포즈 추정, 정책 입력에 대한 깊이 처리.
- ** 하드웨어 추천:** 워크스테이션급 서버 (NVIDIA A4000 또는 RTX 4090, 64 GB RAM, 2 TB NVMe) 는 약 $8,000~$15,000의 하드웨어로 5
10 로봇 클러스터를 처리합니다.
3층: 구름
클라우드 서비스는 지연성, 컴퓨팅 집중적인 작업량 및 함대 규모의 기능을 처리합니다.
- 모델 훈련: 축적된 시범 데이터에 대한 정책 모델 훈련 또는 정비. 이것은 클라우드 GPU 클러스터 (AWS p4d, GCP A100 pods, Lambda Labs) 의 주요 사용 사례입니다.
- 함대 패시보드: 배포에 있는 모든 로봇의 실시간 모니터링
처리량, 오류율, 관절 건강, 작업 완료. - ** 텔레오퍼레이션 리레일:** 원격 운영자 텔레오퍼레이션에서 클라우드는 NAT 통로를 위한 STUN/TURN 인프라와 WebRTC 신호를 제공합니다. 비디오 및 명령 스트림은 가능한 경우 피어-터-피어로 흐릅니다. NAT가 직접 연결을 막는 경우 클라우드 리레를 통해.
- 장기 데이터 호수: 모든 에피소드 데이터는 장기적인 저장, 데이터 세트 구축 및 컴플라이언스 등을 위해 클라우드 객체 저장 (S3 또는 GCS) 에 흐른다.
- ** 모델 서비스 (연연을 견딜 수 있는 작업):** VLM 기반 작업 계획, 자연어 명령어 분석 및 장면 이해
기능별로 지연 예산
| Function | Max 지연시간 | Required Tier | Notes |
|---|---|---|---|
| E-stop / safety halt | <1 ms | Onboard | Never cloud-dependent |
| Joint trajectory execution | <5 ms | Onboard | Hard real-time required |
| Policy inference (manipulation) | 10–50 ms | Edge | Contact tasks need <20 ms |
| Object detection / pose | 20–80 ms | Edge | Depends on task speed |
| 원격조작 video stream | 30–80 ms | Edge / P2P | Above 100 ms degrades operator |
| Task planning (VLM) | 300–2,000 ms | Cloud | 지연시간-tolerant planning |
| Fleet monitoring | 1–10 s | Cloud | Aggregation acceptable |
| Model training | Hours | Cloud | Async, not latency-sensitive |
텔레오퍼레이션 스트리밍 아키텍처
원격 로봇 텔레오퍼레이션은 2가지방 실시간 스트리밍을 필요로 합니다. 로봇에서 운영자에게 비디오, 운영자에서 로봇에 명령어.
- ** 비디오 스트림:** H.264 또는 AV1 코덱을 가진 WebRTC. 엣지 서버에 NVENC 하드웨어 코딩은 코딩 지연기를 <10 ms로 줄이므로 HD 스테레오 비디오에 10
30 Mbps를 목표로 하는 적응 비트 속도. - ** 명령 스트림:** 운영자 컨트롤러에 대한 TLS를 통해 WebSocket을 통해 데이터를 설정합니다. JSON 또는 msgpack 코딩. 100 Hz 업데이트 속도. 최우선 줄을 따라 가장 새로운 명령들은 일시적인 네트워크 혼잡을 때 오래된 명령을 이동합니다.
- NAT 통로가: 대부분의 주거 인터넷 운영자에게는 STUN (Coturn 또는 관리된 STUN 서비스) 이다. 대칭 NAT 또는 엄격한 기업 방화벽 뒤에 운영자에게는 TURN 리레이 필요. TURN 리레이 트래픽에 대한 예산은 ~ $0.10/GB이다.
- 운동자 지연 시범: 헤드셋 HUD에서 운영자에게 종전순환 지연을 표시합니다. 지연이 120 ms를 초과할 때 경고합니다.
데이터 파이프라인: 로봇이 훈련 클러스터로
- ** 에피소드 캡처:** 에피소드 완료되면 엣지 서버는 로컬 NVMe 버퍼에 HDF5 파일 (관측 + 행동 + 메타데이터) 를 작성합니다.
- ** 배경 업로드:** 데몬은 로컬 버퍼를 모니터링하고 다중부 리 업로드를 사용하여 완료된 에피소드를 S3/GCS에 업로드합니다. 로봇 동작에 방해를 피하기 위해 대역폭을 제한합니다. 전형적인 에피소드 크기는: 100
500 MB. - ** 섭취 검증:** 클라우드 측 Lambda/Cloud 함수는 각 업로드 된 에피소드에서 스키마 검증 및 자동화된 품질 검사를 실행합니다.
- ** 훈련 트리거:** 새로운 검증된 에피소드 배트가 사용할 수 있을 때 데이터 세트 버전이 태그됩니다. 이것은 새로운 데이터를 사용하여 GPU 클러스터에서 훈련 작업을 유발합니다.
- 모델 업데이트 OTA: 훈련이 완료되고 오프라인 평가가 통과되면 새로운 모델은 OTA 업데이트 시스템을 통해 가장자리 서버에 밀어붙인다. A/B 테스트 프레임워크는 새로운 모델을 먼저 함대 10%에 배치하고 성공률을 모니터링하고 100%에 이르게합니다.
클라우드 공급자 비교
| Provider | Robot-Specific Service | GPU Options | IoT Integration | Best For |
|---|---|---|---|---|
| AWS | AWS IoT Greengrass, RoboMaker | p4d, p3, g4dn | AWS IoT Core, Greengrass | Enterprise, broad ecosystem |
| GCP | None (general compute) | A100, H100, TPUv4 | Cloud IoT Core (deprecated) | ML training, BigQuery analytics |
| Azure | Azure IoT Hub, Digital Twins | NC A100, ND H100 | IoT Hub, IoT Edge | Microsoft enterprise, mixed reality |
| Custom (Lambda Labs) | None | A100, H100 on-demand | N/A | GPU-only cost optimization |
RCSV [플랫폼]
클라우드 로봇 인프라를 배포
RCSV 플랫폼은 관리되는 클라우드 로봇 인프라를 제공합니다. 함대 모니터링, 데이터 파이프라인과 모델 훈련
[플랫폼을 탐험해 보세요]







