Researchに戻る

2025年のクラウドロボット建築パターン

クラウドに接続されたロボットシステムのための建築パターン <unk> エッジ推理,テレオペレーションストリーミング,艦隊管理,データパイプライン

[←研究]

現代のロボットシステムは,エッジ,オンプレミスのサーバー,クラウドを覆います. 動作する建築パターンと,どこへ行くかを決定する遅延の制限です.

なぜクラウド+ロボット

クラウドコンピューティングの経済学により物理ロボットから遠く離れた大規模なコンピューティングを実行することが実用化され,ネットワーク遅延の進歩 (5G,WiFi 6E) は,卸載が可能であることを拡大しました. 現代ロボット部署は3つの階層のアーキテクチャを使用します.安全性重要なリアルタイム制御のためのオンボードコンピューティング,低遅延推移およびローカルデータバッファリングのためのエッジサーバー,モデルトレーニング,艦隊管理,遠隔操作リレーのためのクラウド.

重要な建築原理は: _ time critical everything runs locally; everything computation-intensive runs in the cloud._ ネットワークの遅延が減少し,端末ハードウェアが強力になるにつれて,ローカルとクラウドの境界が変化します.

建築層

層1: ロボット

ロボットの機内コンピュータは セキュリティ上の重要な 困難なリアルタイム作業を 行います 物理的な安全に影響を与えるものは ネットワーク接続に依存すべきではありません

  • ROS 2制御ノード: 共同軌道の実行,安全監視,電子停止操作. 動作する速度は5001,000 Hz で1 ms jitter でなければならない. 決定的なスケジュール化のために必要な PREEMPT_RTカーネルまたはXenomai.
  • 安全制御器: 共同制限執行,衝突監視,作業場境界チェック.これは最後の防衛線であり,クラウドにアウトソーシングしてはならない.
  • 地方状態の推定: 独自の受容量,IMU融合,ベースオドメトリ. これらは,制御または認識計算の前提条件です.
  • ハードウェア: ほとんどのコラボレーション腕にはオンボードコントローラ (UR コントロールボックス,Franka FCI) が含まれています.モバイルロボットでは,NVIDIA Jetson AGX Orin (275 TOPS INT8) はAIによる強化感知とポリシー実行のための標準端模块です.

層2: エッジサーバー

ローカルサーバー (施設またはロボットルームに並んで配置) は GPU 加速を必要とする計算処理を行うが,遅延は ~50 ms 未満でなければならない.

  • ポリシー推論: ACT,拡散ポリシー,またはOpenVLAの細かな調節されたモデルを実行する.NVIDIA RTX 4090またはA100サーバーは50Hzで同時に520ロボット推論ストリームを処理します.
  • ローカルデータバッファ: クラウド・ラウンド・トリップなしで迅速な回収と再訓練のための最近のエピソード (2448時間稼働) のリングバッファ. NVMe RAIDは書き込み通路のために推奨されています.
  • リアルタイム認識: 対象検出,ポーズ推定,政策入力のための深度処理. 端から端まで <20 msを実行する必要があります.
  • ハードウェアの推奨: ワークステーションクラスのサーバー (NVIDIA A4000 または RTX 4090, 64 GB RAM, 2 TB NVMe) は,約8000$~15,000$のハードウェアで510ロボットクラスタを処理します.

層3 雲

クラウドサービスは,遅延耐性,コンピューティング密集型の作業量および艦隊規模の機能を処理します.

  • モデル訓練: 蓄積されたデモデータに関する政策モデルを訓練または細かく調整する. これはクラウドGPUクラスター (AWS p4d,GCP A100 pods,Lambda Labs) の主要な使用例です.
  • Fleet Dashboard: 部署中のすべてのロボットをリアルタイムで監視する 吞吐量,エラー率,関節健康,タスク完了.遅延耐性 (秒) 積分は受け入れられる.
  • 遠隔操作の電源: 遠隔操作の電源では,クラウドはNATの通行とWebRTCの信号の送信のためのSTUN/TURNインフラストラクチャを提供します.可能な限り,ビデオとコマンドストリームがピアツーピア流し,NATが直接接続を妨げるときはクラウド電源を通じて流します.
  • 長期データ湖: 長期保存,データセット構築訓練,およびコンプライアンスのために,すべてのエピソードデータは最終的にクラウドオブジェクトストレージ (S3またはGCS) に流出します.
  • モデルサービス (遅延耐性作業): VLMベースのタスクプランニング,自然言語指示解析,シーン理解 遅延3001,000 msが許容される場合.

機能による遅延予算

Function Max レイテンシ Required Tier Notes
E-stop / safety halt <1 ms Onboard Never cloud-dependent
Joint trajectory execution <5 ms Onboard Hard real-time required
Policy inference (manipulation) 10–50 ms Edge Contact tasks need <20 ms
Object detection / pose 20–80 ms Edge Depends on task speed
遠隔操作 video stream 30–80 ms Edge / P2P Above 100 ms degrades operator
Task planning (VLM) 300–2,000 ms Cloud レイテンシ-tolerant planning
Fleet monitoring 1–10 s Cloud Aggregation acceptable
Model training Hours Cloud Async, not latency-sensitive

テレオペレーションストリーミングアーキテクチャ

ロボットから遠隔操作には2方向のリアルタイムストリーミングが必要です. ロボットから操作者にビデオ,操作者からロボットにコマンド.

  • ビデオストリーमः H.264 または AV1 コデックを使用した WebRTC. エッジサーバーの NVENCハードウェアエンコーディングはエンコーディング遅延を <10 ms に削減します.HDステレオビデオに1030 Mbpsをターゲットとする適応性ビットレートは.
  • コマンドストリーム: WebSocket オーペレーターコントローラの TLS 上のデータ. JSON または msgpack コーディング. 100 Hz アップデートレート. 最新のコマンドは,一時的なネットワーク渋滞中に古いコマンドを置き去りにします.
  • **NAT 通過:**住宅インターネットのほとんどのオペレーターにとってSTUN (Coturn または管理 STUN サービス).対称的なNATまたは厳格な企業ファイアウォールの後ろのオペレーターにはTURN リレーが必要.TURN リレートラフィックのための予算は ~0.10$/GB.
  • **オペレーター遅延モニタリング:**ヘッドセットHUDで操作者に端から端まで回帰遅延を表示します.遅延が120 msを超えると警告します.

データパイプライン:ロボットから訓練クラスターへ

  • エピソードキャプチャ: エピソード完了時に,エッジサーバーは,ローカルNVMeバッファーに HDF5ファイル (観測 +アクション + メタデータ) を書き込む.
  • 背景アップロード: デイモンがローカルバッファをモニターし,複数のパーツのアップロードを使用して完了したエピソードをS3/GCSにアップロードします.ロボット操作に干渉しないように帯域幅を絞ります.典型的なエピソードサイズ: 100500MB.
  • ** 摂取認証:** クラウドサイドのLambda/Cloud Functionは,アップロードされた各エピソードでスケーマ認証と自動品質チェック ([品質指標記事]T1]を参照) を実行します.失敗したエピソードはレビューキューに隔離されます.
  • トレーニングトリガー: 検証されたエピソードの新しいバッチが利用可能になったとき,データセットバージョンがタグ付けされます. これにより新しいデータを利用して GPUクラスターでトレーニング作業が開始されます.
  • モデル更新OTA: 訓練が完了し,オフライン評価が通過した後,新しいモデルはOTA更新システムを通じて端サーバーに押し付けられます.A/Bテストフレームワークは,新しいモデルを最初に艦隊の10%に展開し,成功率を監視し,その後100%に展開します.

クラウドプロバイダー比較

Provider Robot-Specific Service GPU Options IoT Integration Best For
AWS AWS IoT Greengrass, RoboMaker p4d, p3, g4dn AWS IoT Core, Greengrass Enterprise, broad ecosystem
GCP None (general compute) A100, H100, TPUv4 Cloud IoT Core (deprecated) ML training, BigQuery analytics
Azure Azure IoT Hub, Digital Twins NC A100, ND H100 IoT Hub, IoT Edge Microsoft enterprise, mixed reality
Custom (Lambda Labs) None A100, H100 on-demand N/A GPU-only cost optimization

RCSV [プラットフォーム]T2) は,ロボット側データ収集のためのエッジエージェント,エピソード処理のためのクラウドパイプライン,艦隊モニタリングのためのウェブダッシュボードの管理された実装を提供します チームからインフラをゼロから構築する必要はありません.

クラウドロボットインフラストラクチャを展開する

RCSVプラットフォームは,管理されたクラウドロボットインフラストラクチャを提供します. 艦隊監視,データパイプライン,モデルトレーニング

プラットフォームを探索 →