Research(으)로 돌아가기

2025 년 클라우드 로봇 아키텍처 패턴

클라우드 연결 로봇 시스템 (cloud-connected robot systems) 의 건축 패턴 <unk> 엣지 추론, 텔레오퍼레이션 스트리밍, 함대 관리 및 데이터 파이프라인

[← 연구]

현대 로봇 시스템은 가장자리, 현장 서버, 클라우드를 에 걸쳐 있습니다. 여기 작업하는 건축 패턴과 무엇을 어디로 가는지 결정하는 지연 제한이 있습니다.

클라우드 + 로봇의 이유

클라우드 컴퓨팅의 경제는 물리 로봇에서 멀리 떨어진 상당한 컴퓨팅을 실행하는 것을 실용화했으며, 네트워크 지연성 발전 (5G, WiFi 6E) 은 탈하드를 할 수 있는 것을 확장했습니다. 현대 로봇 배포는 세 단계의 아키텍처를 사용합니다. 안전성 중요한 실시간 제어용 내용 컴퓨팅, 저 지연성 추론 및 로컬 데이터 버퍼링을 위한 엣지 서버, 모델 훈련, 함대 관리 및 텔레오퍼레이션 레일용 클라우드.

핵심 아키텍처 원칙은 다음과 같습니다: _모든 시간적 중요한 것은 로컬에서 실행되며, 컴퓨팅이 많은 모든 것은 클라우드에서 실행됩니다. _ 네트워크 지연이 감소하고 가장자리 하드웨어가 더 강력해질수록 로컬과 클라우드 사이의 경계는 바뀐다.

건축 층

1층: 로봇 탑승

로봇의 탑재 컴퓨터는 안전에 중요한, 어려운 실시간 작업을 수행합니다. 물리적 안전에 영향을 미치는 것은 네트워크 연결에 의존하지 않아야합니다.

  • ROS 2 제어 노드: 공동 궤도 실행, 안전 모니터링, 전자 정지 처리. < 1 ms jitter 과 5001,000 Hz에서 실행되어야 합니다. 결정적인 스케줄링에 필요한 PREEMPT_RT 커널 또는 Xenomai.
  • ** 안전 제어기:** 공동의 제한 집행, 충돌 모니터링, 작업 공간 경계 검사. 이것은 마지막 방어 라인이며 결코 클라우드에 외부에 할당해서는 안 됩니다.
  • ** 지역 상태 추정:** 자기 수용, IMU 합성, 기초 오도메트리.
  • ** 하드웨어:** 대부분의 협업 팔에는 내장 컨트롤러 (UR 제어 상자, Franka FCI) 가 포함되어 있습니다. 모바일 로봇을 위해 NVIDIA Jetson AGX Orin (275 TOPS INT8) 는 AI 향상된 인식 및 정책 실행을위한 표준 가장자 모듈입니다.

계층 2: 엣지 서버

로컬 서버 (시설 또는 로봇 방에 위치하고) 는 GPU 가속이 필요한 계산을 처리하지만 ~ 50 ms 지연기보다 낮아야 합니다.

  • 정책 추론: ACT, 방전 정책 또는 OpenVLA 정비된 모델을 실행합니다. NVIDIA RTX 4090 또는 A100 서버는 50 Hz에서 520 로봇 추론 스트림을 동시에 처리합니다.
  • ** 지역 데이터 버퍼:** 최근 에피소드 (2448 시간 운영) 의 링 버퍼, 클라우드 로드 트리프 없이 빠른 검색 및 재훈련을 위한. NVMe RAID는 기록 처리량을 위해 권장됩니다.
  • ** 실시간 인식:** 객체 탐지, 포즈 추정, 정책 입력에 대한 깊이 처리.
  • ** 하드웨어 추천:** 워크스테이션급 서버 (NVIDIA A4000 또는 RTX 4090, 64 GB RAM, 2 TB NVMe) 는 약 $8,000~$15,000의 하드웨어로 510 로봇 클러스터를 처리합니다.

3층: 구름

클라우드 서비스는 지연성, 컴퓨팅 집중적인 작업량 및 함대 규모의 기능을 처리합니다.

  • 모델 훈련: 축적된 시범 데이터에 대한 정책 모델 훈련 또는 정비. 이것은 클라우드 GPU 클러스터 (AWS p4d, GCP A100 pods, Lambda Labs) 의 주요 사용 사례입니다.
  • 함대 패시보드: 배포에 있는 모든 로봇의 실시간 모니터링 처리량, 오류율, 관절 건강, 작업 완료.
  • ** 텔레오퍼레이션 리레일:** 원격 운영자 텔레오퍼레이션에서 클라우드는 NAT 통로를 위한 STUN/TURN 인프라와 WebRTC 신호를 제공합니다. 비디오 및 명령 스트림은 가능한 경우 피어-터-피어로 흐릅니다. NAT가 직접 연결을 막는 경우 클라우드 리레를 통해.
  • 장기 데이터 호수: 모든 에피소드 데이터는 장기적인 저장, 데이터 세트 구축 및 컴플라이언스 등을 위해 클라우드 객체 저장 (S3 또는 GCS) 에 흐른다.
  • ** 모델 서비스 (연연을 견딜 수 있는 작업):** VLM 기반 작업 계획, 자연어 명령어 분석 및 장면 이해

기능별로 지연 예산

Function Max 지연시간 Required Tier Notes
E-stop / safety halt <1 ms Onboard Never cloud-dependent
Joint trajectory execution <5 ms Onboard Hard real-time required
Policy inference (manipulation) 10–50 ms Edge Contact tasks need <20 ms
Object detection / pose 20–80 ms Edge Depends on task speed
원격조작 video stream 30–80 ms Edge / P2P Above 100 ms degrades operator
Task planning (VLM) 300–2,000 ms Cloud 지연시간-tolerant planning
Fleet monitoring 1–10 s Cloud Aggregation acceptable
Model training Hours Cloud Async, not latency-sensitive

텔레오퍼레이션 스트리밍 아키텍처

원격 로봇 텔레오퍼레이션은 2가지방 실시간 스트리밍을 필요로 합니다. 로봇에서 운영자에게 비디오, 운영자에서 로봇에 명령어.

  • ** 비디오 스트림:** H.264 또는 AV1 코덱을 가진 WebRTC. 엣지 서버에 NVENC 하드웨어 코딩은 코딩 지연기를 <10 ms로 줄이므로 HD 스테레오 비디오에 1030 Mbps를 목표로 하는 적응 비트 속도.
  • ** 명령 스트림:** 운영자 컨트롤러에 대한 TLS를 통해 WebSocket을 통해 데이터를 설정합니다. JSON 또는 msgpack 코딩. 100 Hz 업데이트 속도. 최우선 줄을 따라 가장 새로운 명령들은 일시적인 네트워크 혼잡을 때 오래된 명령을 이동합니다.
  • NAT 통로가: 대부분의 주거 인터넷 운영자에게는 STUN (Coturn 또는 관리된 STUN 서비스) 이다. 대칭 NAT 또는 엄격한 기업 방화벽 뒤에 운영자에게는 TURN 리레이 필요. TURN 리레이 트래픽에 대한 예산은 ~ $0.10/GB이다.
  • 운동자 지연 시범: 헤드셋 HUD에서 운영자에게 종전순환 지연을 표시합니다. 지연이 120 ms를 초과할 때 경고합니다.

데이터 파이프라인: 로봇이 훈련 클러스터로

  • ** 에피소드 캡처:** 에피소드 완료되면 엣지 서버는 로컬 NVMe 버퍼에 HDF5 파일 (관측 + 행동 + 메타데이터) 를 작성합니다.
  • ** 배경 업로드:** 데몬은 로컬 버퍼를 모니터링하고 다중부 리 업로드를 사용하여 완료된 에피소드를 S3/GCS에 업로드합니다. 로봇 동작에 방해를 피하기 위해 대역폭을 제한합니다. 전형적인 에피소드 크기는: 100500 MB.
  • ** 섭취 검증:** 클라우드 측 Lambda/Cloud 함수는 각 업로드 된 에피소드에서 스키마 검증 및 자동화된 품질 검사를 실행합니다.
  • ** 훈련 트리거:** 새로운 검증된 에피소드 배트가 사용할 수 있을 때 데이터 세트 버전이 태그됩니다. 이것은 새로운 데이터를 사용하여 GPU 클러스터에서 훈련 작업을 유발합니다.
  • 모델 업데이트 OTA: 훈련이 완료되고 오프라인 평가가 통과되면 새로운 모델은 OTA 업데이트 시스템을 통해 가장자리 서버에 밀어붙인다. A/B 테스트 프레임워크는 새로운 모델을 먼저 함대 10%에 배치하고 성공률을 모니터링하고 100%에 이르게합니다.

클라우드 공급자 비교

Provider Robot-Specific Service GPU Options IoT Integration Best For
AWS AWS IoT Greengrass, RoboMaker p4d, p3, g4dn AWS IoT Core, Greengrass Enterprise, broad ecosystem
GCP None (general compute) A100, H100, TPUv4 Cloud IoT Core (deprecated) ML training, BigQuery analytics
Azure Azure IoT Hub, Digital Twins NC A100, ND H100 IoT Hub, IoT Edge Microsoft enterprise, mixed reality
Custom (Lambda Labs) None A100, H100 on-demand N/A GPU-only cost optimization

RCSV [플랫폼]T2) 는 이 아키텍처의 관리 구현을 제공합니다 로봇 측 데이터 수집을 위한 엣지 에이전트, 에피소드 처리을위한 클라우드 파이프라인, 그리고 함대 모니터링을 위한 웹 패시보드

클라우드 로봇 인프라를 배포

RCSV 플랫폼은 관리되는 클라우드 로봇 인프라를 제공합니다. 함대 모니터링, 데이터 파이프라인과 모델 훈련

[플랫폼을 탐험해 보세요]