Guides(으)로 돌아가기

원격 로봇 함대 관리: 모니터링, 진단 및 운영

로봇을 원격으로 관리하는 방법 <unk> 텔레메트리, OTA 업데이트, 원격 액세스, 사고 대응 및 KPI 추적.

[← 가이드]

5~500개의 로봇을 여러 사이트에서 실행하는 팀들을 위한 실용적인 운영 가이드

함대 관리 스택 구성 요소

생산급 함대 관리 시스템은 다섯 가지 필수 요소를 가지고 있습니다. 대부분의 팀은 이 요소들을 단계적으로 구축합니다. 텔레메트리와 원격 접근으로 시작하여, 업데이트 시스템을 추가하고 함대 규모가 10 개의 로봇을 넘어서는 알림을 추가합니다.

  • ** 장치 레지스트리:** 함대 내 모든 로봇의 데이터베이스 일련 번호, 모델, 펌웨어 버전, 위치, 할당된 운영체제 및 현재 상태. 이것은 다른 모든 시스템에 대한 진실의 원천입니다. 간단한 PostgreSQL 테이블이 작동합니다. AWS IoT 또는 Azure IoT Hub과 같은 목적으로 구축 된 솔루션은 이를 규모로 제공합니다.
  • ** 텔레메트리 파이프라인:** 로봇에서 클라우드로 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개 매개
  • ** 원격 접근 계층:** 원격 접근 방법 섹션에서 상세히 논의된 물리적인 존재 없이 로봇을 검사하고 제어하기 위해 운영자 및 엔지니어들의 인증 된 접근.
  • OTA 업데이트 시스템: 현장에서 로봇에게 펌웨어, 소프트웨어 및 정책 업데이트를 추진하는 메커니즘. 단계적 배포 및 롤백 기능은 협상 할 수 없습니다.
  • ** 경고 및 호출:** 전화기 엔지니어에게 격상되는 이상의 자동 검출.

수집할 수 있는 텔레미터

과잉 텔레메트리는 비용과 잡음을 증가시킵니다. 이것들은 지속적으로 가치 있는 측정값입니다.

  • **공동 온도:**공동 모터 온도 °C. 70°C에서 경고 (주의), 85°C에서 응급정지. 상승 온도는 마찰 증가, 임박하는 베어링 실패 또는 과부하 작업 프로파일의 초기 지표입니다.
  • 공동 오류 코드: 모터 드라이버의 오류 코드, 시간표 및 공동 ID로 기록되어 있습니다. 오류 코드를 모니터링 대시보드에 인간으로 읽을 수 있는 설명으로 해독해야 합니다.
  • ** 배터리 충전 상태 및 전압:** 배터리 % 및 전압 1분 간격으로. 배터리 수명주기 관리에 대한 트랙 충전 주기의 수요.
  • ** 작업 성공/실패율:** 작업 유형, 기간 및 실패 모드로 에피소드 당 결과. 주요 비즈니스 KPI.
  • ** 네트워크 지연:** 30초 간격으로 로봇에서 클라우드로 돌아가는 지연.
  • ** 카메라 건강:** 카메라당 프레임 속도 및 프레임 수 감소. 카메라의 프레임 수 감소 > 5%는 하드웨어 문제 또는 USB 대역폭 포화 를 나타냅니다.

모니터링 인프라

표준 오픈소스 모니터링 스택은 ~ 200 유닛까지의 로봇 함대에서 잘 작동합니다.

  • 프로메테우스 + 그래파나: 프로메테우스 는 각 로봇의 함대 에이전트가 15 초 간격으로 노출하는 측정 끝점을 스크래프한다. 그래파나는 함대 수준의 대시보드를 시각화한다. 전체 운영 시간, 각 로봇의 건강, 작업 처리량 및 알림 역사.
  • InfluxDB: 고 주파수 텔레메트리 (100 Hz에서 공동 위치) 에서, 프로메테우스 (고 주파수, 고 주파수 데이터에 최적화되지 않은) 대신 InfluxDB의 시간 시리즈 압축을 사용하십시오.
  • PagerDuty: 전화 중순 및 경보 격상 관리. 자동화된 사고 생성을 위해 Prometheus alertmanager → PagerDuty를 통합하십시오. 안전 경보 (간격 페이지) 와 유지보수 경보 (사업시간에서만) 에 대한 격상 정책을 분리합니다.
  • ** 사용자 정의 함대 건강 다시보드:** [플랫폼] (T5) 에서 단일 화면 "미션 제어" 표시를 구축하여: 상태 지표와 함께 모든 로봇 위치 지도, 상위 5 개의 실패 작업, 함대 운영 시간 비율 및 유지보수가 필요한 로봇을 표시합니다.

원격 접근 방법

Method 지연시간 Security Best For
SSH over VPN (WireGuard) 20–80ms depending on VPN server location High — key-based auth, encrypted tunnel Engineering diagnostics, log review, config changes
WebRTC remote desktop 50–150ms Medium — requires signaling server security Operator GUI access, rviz2 visualization
ROS2 bridge (rosbridge_suite) 30–100ms Low by default — add TLS + auth explicitly Programmatic telemetry access, remote monitoring scripts

WireGuard VPN는 모든 원격 액세스을위한 권장 기반입니다. WireGuard 서버를 배포하십시오 (예를 들어, $ 5 월 디지털 오션 드롭렛) 그리고 각각의 로봇을 고유의 키 짝으로 WireGuard 클라이언트로 구성하십시오. 모든 원격 액세스은 VPN 터널을 통해 발생합니다.

경고 의 임대

Metric Warning Threshold Emergency Threshold Automated Action
Joint temperature >70°C >85°C Emergency: immediate e-stop
Task success rate (7-day rolling) <80% <60% Emergency: suspend policy, alert on-call
Battery SoC <20% <10% Emergency: return to charger or alert operator
Network latency (robot→cloud) >200ms >500ms Warning: log; Emergency: disable teleoperation
Camera frame drop rate >5% >20% Warning: log; Emergency: pause data collection
Consecutive task failures 3 in a row 5 in a row Warning: operator alert; Emergency: suspend + escalate

OTA 업데이트 프로세스

오브-더-아어 업데이트는 사이트 방문 없이 배치된 로봇에 개선 및 보안 수정 사항을 전송하는 방법입니다. 정해진 업데이트 프로세스는 업데이트가 인신스 발생을 방지합니다.

  • Build: 모든 업데이트 (실제 소프트웨어 또는 정책) 는 CI에 구축되어 sha256 체크섬을 가진 버전 된 유물을 생성합니다. 유물은 출시 레지스트리 (S3 버킷 또는 유물 레지스트리) 에 저장됩니다.
  • ** 스테이지 테스트:** 현장 배치 전에 업데이트는 실험실에서 23 스테이지 로봇에 적용되며 50 번의 자동 테스트 스위트로 검증됩니다.
  • 캐나리 투입 (10%): 함대 10% (또는 최소 3 개의 로봇) 에 48 시간 동안 투입.
  • ** 완전 출동:** 캐나리 메트릭이 명칭적이라면, 나머지 함대로 출동. 함대 전체의 정전 시간을 초래하는 동시 재발전을 피하기 위해 시간당 25%로 출동을 십시오.
  • 돌이돌기 기능: 모든 로봇은 이전 버전의 유물을 현지에서 유지합니다.돌이돌기는 <2분 소요되며 관리 패시보드에서 로봇당 또는 함대 전체에서 활성화 될 수 있습니다.

함대 KPIs

KPI Definition Target Measurement Interval
MTBF (Mean Time Between Failures) Average operating hours between unplanned stoppages >200 hours Monthly
MTTR (Mean Time to Repair) Average time from incident detection to resumed operation <2 hours Monthly
Fleet uptime % of scheduled operating hours spent in active operation >95% Weekly
Task completion rate % of tasks completed successfully without human intervention >90% Daily
OTA update success rate % of update deployments that succeed without rollback >99% Per-release

연결 옵션: 상세한 비교

Option Typical 지연시간 Bandwidth Cost/Robot/Month Best For
WireGuard VPN over WiFi 20-80 ms 100+ Mbps $5 (VPN server) Lab and warehouse with existing WiFi
WireGuard VPN over 5G 15-40 ms 100-500 Mbps $30-$80 (data plan) Mobile robots, outdoor, no WiFi available
Tailscale (managed WireGuard) 20-80 ms 100+ Mbps $0-$18/device Quick setup, NAT traversal, SSO integration
WebRTC peer-to-peer 50-150 ms 10-50 Mbps $0 (STUN/TURN server) Browser-based remote viewing, video streams
Wired Ethernet (on-premise) <1 ms 1 Gbps $0 (existing infra) Fixed arm installations, highest reliability

대부분의 배포에 대한 권장 아키텍처는: ** 로봇 LAN** (팔 컨트롤러에서 작업장) 에 대한 와이어에스넷, ** 원격 액세스 ** (인женер 노트북에서 로봇) 에 대한 와이파이 또는 클라우드 텔레메트리 업로드**에 대한 5G입니다. 이것은 제어 루프에 대한 미리초 이하의 지연을 제공하며 안전한 원격 액세스 기능을 제공합니다.

오류 탐지 및 자동 복구

잘 설계된 함대 관리 시스템은 인간 개입 없이 일반적인 오류로부터 회복되며 MTTR를 시간에서 분으로 줄여줍니다.

  • ** 감시 개 타이머:** 탑승 함대 에이전트는 10초마다 심장 박동을 보내다. 함대 관리자가 30초 동안 심장 박동을 받지 않으면 로봇을 "취급 불가능"로 표시하고 네트워크 진단 순서 (핑, 트래서루트, DNS 확인) 를 유발합니다. 로봇이 5분 동안 도달 불가능하다면 PagerDuty 인시멘트를 생성합니다.
  • ** 자동 프로세스 재 시작:** 모든 로봇 소프트웨어 (ROS2 런칭, 함대 에이전트, 카메라 드라이버) 에 시스템d 서비스 유닛을 사용하십시오. T0T1로 구성하십시오. 이것은 프로세스 충돌 (Segfaults, OOM kills) 에서 자동으로 복구됩니다. 모든 재 시작 이벤트를 텔레메트리 파이프라인에 로그하십시오.
  • ** 카메라 복구:** USB 카메라가 가끔 버스에서 떨어집니다. 함대 에이전트는 T2 장치 노드를 모니터링합니다. 카메라가 사라지면 에이전트는 포트에 T3을 실행하고 3 초를 기다립니다. 그리고 카메라가 다시 나타나는지 확인합니다. 3 번의 시도 후에 안되면 물리적인 검사에 대해 운영자에게 알리십시오.
  • ** 네트워크 결함이:** 와이파이 및 셀룰러 연결을 갖춘 로봇에 대해 자동 결함이 설정하세요: 와이파이 지연이 200 ms를 30 초 이상하면, 텔레메트리와 API 트래픽을 셀룰러 백업으로 전환하고 60 초 동안 지연이 100 ms 이하로 떨어지면 와이파이로 다시 전환하십시오.
  • ** 디스크 공간 관리:** HDF5 데이터 수집은 디스크를 빠르게 채울 수 있습니다 (3 카메라 30fps = ~50GB/h). 함대 에이전트는 디스크 사용량을 모니터링하고, 디스크 70%를 초과할 때 완료된 에피소드를 NAS 또는 클라우드 스토리지로 자동으로 전송합니다. 90%에서, 공간이 방출될 때까지 데이터 수집을 중단합니다.

RCSV 플랫폼 통합

RCSV 플랫폼 는 관리된 함대 관리 계층을 제공하여 사용자 정의 모니터링 인프라 구축의 필요성을 제거합니다.

  • ** 함대 대시보드:** 모든 로봇 위치의 실시간 지도와 상태 지표 (녹색/ 노란색/ 빨간색) 를 클릭하여 실시간 텔레메트리, 카메라 피드 및 작업 역사를 볼 수 있습니다.
  • ** 텔레메트리 파이프라인:** 로봇은 MQTT를 통해 플랫폼의 InfluxDB 백엔드로 메트릭을 전송합니다. 공동 건강, 작업 수행 및 함대 활용을 위한 미리 구축된 Grafana 대시보드.
  • OTA 업데이트 관리자: 새로운 펌웨어, 소프트웨어 또는 정책 유물을 플랫폼에 업로드하십시오. 자동 카나리 테스트 및 한 번의 클릭으로 배포를 진행하십시오.
  • 주의사항 라우팅: 이메일, Slack, PagerDuty 또는 플랫폼의 내장된 알림 시스템으로 라우팅을 통해 경고 규칙을 구성 (계약 기반 또는 기상 탐지)

관련 가이드

  • 로봇 API 통합 안내 - 함대 통신에 필요한 API 패턴
  • [정책의 생산에 대한 배포]T8) - 함대 전체에 걸쳐 정책을 배포하고 모니터링
  • [예방적 유지 관리 일정은]T9) - 함대 운영에 대한 유지 관리 계획
  • 로봇 안전 위험 평가 -- 분산 함대 배치에 대한 안전 요구 사항
  • [하우스 배치 체크리스트]T11) -- 생산 환경에서 함대 배치

RCSV와 작업

RCSV는 모든 규모의 로봇 배치에 대한 함대 관리 인프라를 제공합니다.

  • 데이터 플랫폼 -- 관리된 함대 패시보드, 텔레메트리, OTA 업데이트 및 알림 라우팅
  • 정비 및 유지보수 - 원격 진단 및 함대 로봇 현장 서비스
  • Robot Leasing -- 선착륙 로봇을 선착륙된 선착륙 관리 요원들과 임대
  • [우리와 연락하세요]

한 대시보드 에서 함선을 관리 하는 것

RCSV 플랫폼은 모든 규모의 로봇 운영자에게 함대 텔레메트리, OTA 업데이트 관리 및 원격 액세스 기능을 제공합니다.

[플랫폼을 탐험]