Researchに戻る

リアルタイムロボットインフェレンスは:エッジ対クラウドアーキテクチャ ト્રેડオフ

ローボット政策推論を Edge vs Cloud で実行する時 遅延分析,ハードウェアオプション,モデル量化,コスト比較

[←研究]

ロボット政策の推論アーキテクチャは どのモデルを 実行できるのか どれだけのコストで どの遅延を保証できるのか 決定します

作業タイプによる遅延要求

推理アーキテクチャを選択する前に,作業に必要な正確な遅延要求が必要です.必要な遅延は,ロボットの制御周波数と操作の性質によって設定されます.

  • 自由空間移動 (目標に向かって移動する腕): 50100 ms の推理遅延は許容される.腕は接近段階では低速度で移動し,100 ms のステール ポリシー 查询では,タスク 許容量を超えた位置付けエラーが発生しない.
  • コンタクトに富んだ操作 (挿入,組み立て): 1020 msの推理遅延が必要.コンタクトの瞬間に,小さな状態変更 (0.51 mmの位置エラー) がタスクの失敗を引き起こす可能性があるため,ポリシーは頻繁にリクエストする必要があります.
  • 反応的な把握 (移動対象,輸送機): <50 ms 必要 政策の問い合わせの間,オブジェクトの位置が変化する.
  • 安全性・重要な停止: <1 ms. これは,政策推論ループに依存することはできません.

エッジハードウェアオプション

端末推論ハードウェアはロボットと並列に動作し,ネットワークの回帰遅延を排除します.トレードオフは上でのコストと地元のメンテナンス責任が高くなります.

Hardware TOPS (INT8) Price Power Form Factor Best For
NVIDIA Jetson AGX Orin 64GB 275 TOPS $499 (module) 15–60W Embedded module Full policy inference at edge
NVIDIA Jetson Orin NX 16GB 100 TOPS $299 (module) 10–25W Embedded module Smaller models, power-constrained
NVIDIA RTX 4090 (workstation) ~1,600 TOPS (FP16) $1,600 450W TDP Desktop PCIe Large model inference, multiple robots
Intel NUC with Arc GPU ~40 TOPS $600–$900 35W Mini PC Simple BC policies, low cost
Raspberry Pi 5 ~5 TOPS $80 5–10W SBC MLP policies only, very simple tasks

ACTまたは拡散ポリシーを実行するほとんどの操作作業では,NVIDIA Jetson AGX Orinが選択のエッジハードウェアである.その275 TOPS INT8性能は,ACT推論を3080 msで,量子化拡散を2050 msで処理する.

モデルサイズ対インフェレンスの遅延

Model Parameters Edge (Jetson AGX) Cloud (A100) Quantized INT8 Edge
BC (MLP policy) ~1M 1–3 ms <1 ms 1–2 ms
ACT (original) ~84M 50–100 ms 15–30 ms 20–50 ms (FP16)
Diffusion Policy (U-Net) ~100M 30–80 ms 10–30 ms 20–50 ms
Diffusion Policy (Transformer) ~300M 200–500 ms 80–200 ms 100–250 ms
OpenVLA (7B) 7B 3–10 s 200–500 ms 1–3 s (INT4)
Octo (93M) 93M 30–100 ms 15–40 ms 20–60 ms

量化戦略

量子化により,メモリ足跡を減らすためにモデル精度が低下し,精度に代償を払って推理速度が増加します.

  • FP32 → FP16 (半精度): 2×メモリ削減,ほとんどの操作モデルで<13%の精度損失.パスカルの後 NVIDIA GPUのすべてにネイティブサポートされています. 端部署のデフォルトとして推奨されています.
  • FP16 → INT8: さらに2倍メモリ削減,操縦政策に典型的精度損失1015%. L1L2タスクでは受け入れられる. L3+精度タスクでは注意深くテストする. Jetson最適化された INT8推論のためにNVIDIA TensorRTを使用する.
  • FP16 → INT4 (4ビット): 4×削減対 FP16. 1525%精度低下.主にLLMベースのモデル (OpenVLA) に有用である.言語の脊椎がほとんどのパラメータを表している.Bitsandbytes (NF4形式) またはGPTQを使用する.
  • TensorRT最適化: 量子化を超えて,TensorRTは動作を融合し,メモリレイアウトを最適化し,ターゲットジェットソンハードウェアの最適化された CUDAカーネルにコンパイルします.しばしばコンボルショナルモデルではFP16量子化に加えて24×の追加スピードアップを提供します.

クラウドインフェレンスは: 受け入れられる時

クラウド推理は,遅延許容性がある特定の使用事例において実行可能である.

  • 政策選択/タスク計画: 次の低レベルのスキルを実行する高レベルのプランナーが500 ms2sの遅延を許容できる.これは自然な分割点です.クラウドでVLMベースのプランニングを実行し,低レベルのスキルを端で実行します.
  • シーン理解: 操作を開始する前にロボットが停止した場合,プレグラスプ計画のためのセマニックシーン分析 (オブジェクト分類,価格推定) はクラウドで実行できます.
  • リアルタイムではない遠隔操作監視: ロボットの動作を監視し,異常を検知するクラウドベースの監視システム (直接制御を受けずに) は,遅延を許容します.

費用比較: 1年 TCO

Approach Upfront Ongoing/Year 1-Year TCO Notes
Jetson AGX Orin (1 robot) $500–$800 $0 (owned) $800 Carrier board adds $200–400
RTX 4090 workstation (5 robots) $3,000 $0 (owned) $3,000 $600/robot amortized over 1 year
Cloud GPU (A100, on-demand) $0 $2,200–$4,400 $2,200–$4,400 $0.25–$0.50/hr × 8,760 hr (24/7)
Cloud GPU (reserved instance) $0 $800–$1,600 $800–$1,600 ~50% discount for 1-year reservation
Jetson + cloud hybrid $500–$800 $400–$800 $900–$1,600 Edge for real-time, cloud for training

端末ハードウェアは24時間営業で決定的に勝利する.GPU利用率が <40% (オンデマンド価格設定) の開発と細かな調整サイクルでクラウドが勝利する.ハイブリッドアプローチは生産推論の端,定期的な再訓練のは両方の中で最高のものを提供します.

RCSV プラットフォーム は開発と評価のためのクラウド推理エンドポイントを提供し,生産のためのエッジデプロイメントパッケージ (TensorRT, Jetson) を提供します.

ロボット政策のためのエッジとクラウドインフェレンスは

RCSVは政策訓練,エッジデプロイメントパッケージ (TensorRT/Jetson) とクラウド推論エンドポイントを開発に提供します.

プラットフォームを探索 →