Guidesに戻る

遠隔ロボット艦隊管理:監視,診断,運用

遠隔操作 遠隔測定 OTA アップデート 遠隔アクセス 事件対応 キーPI追跡

[←ガイド]

複数のサイトで 5〜500台のロボットを操作するチームのための実用操作ガイド 遠隔測定からOTA更新までの全スタックをカバーする.

艦隊管理スタック構成要素

生産レベルの艦隊管理システムには5つの基本要素があります.ほとんどのチームはこれらの要素を段階的に構築します. 遠隔測定と遠隔アクセスから始め,その後更新システムを追加し,艦隊が10台のロボットに過ぎると警告します.

  • デバイスレジストリ: 艦隊内のすべてのロボットに関するデータベース 序列番号,モデル,ファームウェアバージョン,位置,割り当てられたオペレーター,および現在の状態.これは他のすべてのシステムのための真実の源です.シンプルなPostgreSQLテーブルが機能します.AWS IoTやAzure IoT Hubのような目的的に構築されたソリューションはこれを規模で提供します.
  • テレメトリパイプライン: ロボットからクラウドへメトリックストリーミング.通常は,ロボットからMQTTまたはgRPC,タイムシリーズデータベース (InfluxDBまたは TimescaleDB) に吸収される. 目標操作メトリックの遅延は <10秒,安全性重要な信号では <1秒.
  • リモートアクセス層: 物理的な存在のないロボットを検査し制御するためのオペレーターやエンジニアの認証アクセス. リモートアクセス方法セクションで詳細に説明します.
  • OTA更新システム: フィールド内のロボットにファームウェア,ソフトウェア,ポリシー更新を押し付けるメカニズム. 段階的な展開とロールバック機能は交渉できない.
  • アラート・オン・コール: 自動で異常を検知し,オン・コールエンジニアにエスカレートする.

収集する電測

過剰なテレメトリはコストを増加させ 騒音を生み出します

  • **関節温度:**関節あたりモーター温度°C. 70°C (警告) で警告,85°Cで緊急停止.高温は摩擦の増加,臨近軸承故障,または過負荷の作業プロフィールの早期指標である.
  • ** 共同エラーコード:** 自動運転手からのエラーコードは,タイムスタンプと共同IDで記録されます.エラーコードは,モニタリングダッシュボードの人間読める記述に解読する必要があります.
  • バッテリー充電状態と電圧: 1分間隔でバッテリー %と電圧.
  • **タスク成功/失敗率:**タスクタイプ,期間,失敗モードによるエピソード毎の結果. 主要事業KPI.
  • ネットワーク遅延: ロボットからクラウドへの回帰遅延は30秒間隔で.
  • **カメラの健康:**カメラあたりフレーム速さとフレーム数値低下.カメラがフレームの5%以上低下するとハードウェア問題やUSB帯域幅飽和性を示します.

監視インフラストラクチャ

標準的なオープンソースモニタリングスタックは, ~ 200 ユニットまでのロボット艦隊にうまく機能します.

  • プロメテウス + グラファナ: プロメテウスは,各ロボット艦隊エージェントが15秒間隔で暴露するメトリックエンドポイントをスクラップします.グラファナは,艦隊レベルのダッシュボードを視覚化します.総動作時間,各ロボット健康,タスク吞吐量,アラート履歴.ロボット艦隊のためのプリビルドされたグラファナダッシュボードは,grafana.com/grafana/dashboardsで利用できます.
  • InfluxDB: 高周波テレメトリ (100 Hzでの合同位置) では,高周波データに最適化されていない Prometheus (ではなく,InfluxDBのタイムシリーズ圧縮を使用してください).
  • PagerDuty: 呼び出しの回転とアラートのエスカレーションを管理する.自動発生発生のためのプロメテウスアラートマネージャー →PagerDutyを統合する.安全アラートの (即時ページ) 対メンテナンスアラートの (営業時間のみ) エスカレーションポリシーを別々に定義する.
  • カスタム・フリット健康ダッシュボード: [プラットフォーム] (T5) で単画面の"ミッション制御"表示を構築し,状態指標,トップ5の失敗作業,フリット稼働率,メンテナンスを必要とするロボットの地図を表示します.

リモートアクセス方法

Method レイテンシ Security Best For
SSH over VPN (WireGuard) 20–80ms depending on VPN server location High — key-based auth, encrypted tunnel Engineering diagnostics, log review, config changes
WebRTC remote desktop 50–150ms Medium — requires signaling server security Operator GUI access, rviz2 visualization
ROS2 bridge (rosbridge_suite) 30–100ms Low by default — add TLS + auth explicitly Programmatic telemetry access, remote monitoring scripts

WireGuard VPNはすべてのリモートアクセスのための推奨基盤です.WireGuardサーバーを展開 (例えば,5ドル/月のDigitalOceanドロップレット) で,各ロボットをWireGuardクライアントとしてユニークなキーペアで設定します.すべてのリモートアクセスがVPNトンネルを通じて行われます.

警告の 限界

Metric Warning Threshold Emergency Threshold Automated Action
Joint temperature >70°C >85°C Emergency: immediate e-stop
Task success rate (7-day rolling) <80% <60% Emergency: suspend policy, alert on-call
Battery SoC <20% <10% Emergency: return to charger or alert operator
Network latency (robot→cloud) >200ms >500ms Warning: log; Emergency: disable teleoperation
Camera frame drop rate >5% >20% Warning: log; Emergency: pause data collection
Consecutive task failures 3 in a row 5 in a row Warning: operator alert; Emergency: suspend + escalate

OTA アップデートプロセス

オーバーザ・エア更新は,サイト訪問なしで,導入されたロボットに改善やセキュリティ修正を送信する方法です. 規律的な更新プロセスは更新がインシデントを引き起こすのを防ぐ:

  • Build: 各更新 (ファームウェア,ソフトウェア,ポリシー) は CI で構築され,sha256 チェックサムを持つバージョン化されたアーティファクトを生成します.アーティファクトはリリースレジストリ (S3 バケットまたはアーティファクトレジストリ) に保存されます.
  • ステージテスト: フィールド展開前に,更新は実験室で23つのステージロボットに適用され,50回の自動テストセットで検証されます.
  • カナリー部署 (10%): 艦隊の10% (または少なくとも3台のロボット) に 48時間部署する. 逆転の成功率,エラーコード,テレメトリを監視する.
  • 完全展開: カナリーメトリックが名値である場合は,残りの艦隊に展開する.同時再起動により艦隊全体の停航を防ぐために,毎時間25%で展開をスタッシングする.
  • Rollback機能: 各ロボットが先行バージョンのアーティファクトを本地的に保持する.Rollbackは <2分かかります.管理ダッシュボードから各ロボットまたは艦隊全体で起動できます.

艦隊KPI

KPI Definition Target Measurement Interval
MTBF (Mean Time Between Failures) Average operating hours between unplanned stoppages >200 hours Monthly
MTTR (Mean Time to Repair) Average time from incident detection to resumed operation <2 hours Monthly
Fleet uptime % of scheduled operating hours spent in active operation >95% Weekly
Task completion rate % of tasks completed successfully without human intervention >90% Daily
OTA update success rate % of update deployments that succeed without rollback >99% Per-release

接続オプション:詳細な比較

Option Typical レイテンシ Bandwidth Cost/Robot/Month Best For
WireGuard VPN over WiFi 20-80 ms 100+ Mbps $5 (VPN server) Lab and warehouse with existing WiFi
WireGuard VPN over 5G 15-40 ms 100-500 Mbps $30-$80 (data plan) Mobile robots, outdoor, no WiFi available
Tailscale (managed WireGuard) 20-80 ms 100+ Mbps $0-$18/device Quick setup, NAT traversal, SSO integration
WebRTC peer-to-peer 50-150 ms 10-50 Mbps $0 (STUN/TURN server) Browser-based remote viewing, video streams
Wired Ethernet (on-premise) <1 ms 1 Gbps $0 (existing infra) Fixed arm installations, highest reliability

ほとんどの部署では,推奨アーキテクチャは: ロボットLAN** (アームコントローラからワークステーション) のためのワイヤードイーサネット**,リモートアクセス** (エンジニアラップトップからロボット) のためのWireGuard VPN,およびクラウドテレメトリアップロード**のためのWiFiまたは5Gです.これは制御ループのサブミリ秒遅延を提供し,安全なリモートアクセスが可能になります.

障害検出と自動復元

設計された艦隊管理システムでは,人間の介入なしに一般的な故障から回復し,MTTRを数時間から数分に削減します.

  • ウォッチドッグタイマー: 船上艦隊エージェントは10秒ごとに心臓拍数を送信します.艦隊管理者が30秒間に心臓拍数を受信しない場合は,ロボットを"到達できない"とマークし,ネットワーク診断シーケンス (ピン,トラサールート,DNSチェック) を起動します.ロボットが5分間に到達できない場合は,PagerDutyインシデントを作成します.
  • 自動プロセス再起動:** すべてのロボットソフトウェア (ROS2 起動,艦隊エージェント,カメラドライバー) にシステムd サービスユニットを使用する. T0T1 で設定する.このプロセスのクラッシュ (セグフォール,OOM 死亡) から自動的に回復する.すべての再起動イベントをテレメトリパイプラインにログインする.
  • カメラ回復: USBカメラは時々バスから落ちます.艦隊エージェントは T2デバイスノードを監視します.カメラが消えた場合,エージェントはポートに T3を実行し,3秒待ち,カメラが再び現れることを確認します.もし3回の試みの後には,物理検査を操作者に通知します.
  • ネットワーク故障: WiFiと携帯電話接続の両方のロボットでは,自動故障を設定します. WiFi遅延が30秒間にわたって200 msを超えると,テレメトリとAPIトラフィックを携帯電話バックアップに切り替えます. 60秒間に遅延が100 ms未満になるとWiFiに戻ります.
  • ディスクスペース管理: HDF5 データ収集はディスクを迅速に埋めることができます (3カメラは30 fps = ~50 GB/h).艦隊エージェントはディスクの使用を監視し,ディスクが70%を超えると完了したエピソードを自動的にNASまたはクラウドストレージに転送します.90%では,スペースが解放されるまでデータ収集を停止します.

RCSVプラットフォーム統合

RCSVプラットフォーム は,カスタマイズされた監視インフラストラクチャを構築する必要性を排除する管理された艦隊管理層を提供します.

  • 艦隊ダッシュボード: 状態指標 (緑/黄色/赤) を含むすべてのロボットの位置のリアルタイムマップ. リアルタイムテレメトリ,カメラフィード,タスク履歴を見るために,任意のロボットをクリックします.
  • テレメトリパイプライン: ロボットはMQTTを通じてメトリックをプラットフォームのInfluxDBバックエンドに送信します.
  • OTA アップデートマネージャー: 新しいファームウェア,ソフトウェア,またはポリシーアーティファクトをプラットフォームにアップロードする.自動カナリーテストと1クリックでロールバックで段階的な展開を予定する.
  • アラートルーティング: メール,Slack,PagerDuty,またはプラットフォームの内蔵通知システムへのルーティングでアラートルールを設定する (しきい値に基づくまたは異常検出).

関連ガイド

  • ロボットAPI統合ガイド - 艦隊通信のためのAPIパターン
  • [政策展開生産] (T8) -- 艦隊全体における政策展開と監視
  • [予防維持計画]T9) - 艦隊運用の維持計画
  • [ロボット安全リスク評価]T10) --分散型艦隊部署に対する安全要件
  • [倉庫部署チェックリスト]T11) --生産環境における艦隊部署

RCSVとの作業

RCSVは,あらゆる規模でのロボット部署のための艦隊管理インフラストラクチャを提供します.

  • データプラットフォーム --管理された艦隊ダッシュボード,テレメトリ,OTA更新,アラートルーティング
  • [修理・メンテナンス] (T13) - 遠隔診断と艦隊ロボットのための現場サービス
  • ロボットリース -- 艦隊準備ができているロボットを,既に設置された艦隊管理代理店とリースする
  • [私たちと連絡してください] T15] - 配備のための艦隊建築レビューを要請する

艦隊 を 一つの 計測器板 から 管理 する

RCSVプラットフォームは,あらゆる規模でのロボット操作者向けに,艦隊テレメトリ,OTA更新管理,そして遠隔アクセスを提供しています.

[プラットフォームを探求]