リアルタイムロボットインフェレンスは:エッジ対クラウドアーキテクチャ ト્રેડオフ
ローボット政策推論を Edge vs Cloud で実行する時 遅延分析,ハードウェアオプション,モデル量化,コスト比較
[←研究]
ロボット政策の推論アーキテクチャは どのモデルを 実行できるのか どれだけのコストで どの遅延を保証できるのか 決定します
作業タイプによる遅延要求
推理アーキテクチャを選択する前に,作業に必要な正確な遅延要求が必要です.必要な遅延は,ロボットの制御周波数と操作の性質によって設定されます.
- 自由空間移動 (目標に向かって移動する腕): 50
100 ms の推理遅延は許容される.腕は接近段階では低速度で移動し,100 ms のステール ポリシー 查询では,タスク 許容量を超えた位置付けエラーが発生しない. - コンタクトに富んだ操作 (挿入,組み立て): 10
20 msの推理遅延が必要.コンタクトの瞬間に,小さな状態変更 (0.5 1 mmの位置エラー) がタスクの失敗を引き起こす可能性があるため,ポリシーは頻繁にリクエストする必要があります. - 反応的な把握 (移動対象,輸送機): <50 ms 必要 政策の問い合わせの間,オブジェクトの位置が変化する.
- 安全性・重要な停止: <1 ms. これは,政策推論ループに依存することはできません.
エッジハードウェアオプション
端末推論ハードウェアはロボットと並列に動作し,ネットワークの回帰遅延を排除します.トレードオフは上でのコストと地元のメンテナンス責任が高くなります.
| Hardware | TOPS (INT8) | Price | Power | Form Factor | Best For |
|---|---|---|---|---|---|
| NVIDIA Jetson AGX Orin 64GB | 275 TOPS | $499 (module) | 15–60W | Embedded module | Full policy inference at edge |
| NVIDIA Jetson Orin NX 16GB | 100 TOPS | $299 (module) | 10–25W | Embedded module | Smaller models, power-constrained |
| NVIDIA RTX 4090 (workstation) | ~1,600 TOPS (FP16) | $1,600 | 450W TDP | Desktop PCIe | Large model inference, multiple robots |
| Intel NUC with Arc GPU | ~40 TOPS | $600–$900 | 35W | Mini PC | Simple BC policies, low cost |
| Raspberry Pi 5 | ~5 TOPS | $80 | 5–10W | SBC | MLP policies only, very simple tasks |
ACTまたは拡散ポリシーを実行するほとんどの操作作業では,NVIDIA Jetson AGX Orinが選択のエッジハードウェアである.その275 TOPS INT8性能は,ACT推論を30
モデルサイズ対インフェレンスの遅延
| Model | Parameters | Edge (Jetson AGX) | Cloud (A100) | Quantized INT8 Edge |
|---|---|---|---|---|
| BC (MLP policy) | ~1M | 1–3 ms | <1 ms | 1–2 ms |
| ACT (original) | ~84M | 50–100 ms | 15–30 ms | 20–50 ms (FP16) |
| Diffusion Policy (U-Net) | ~100M | 30–80 ms | 10–30 ms | 20–50 ms |
| Diffusion Policy (Transformer) | ~300M | 200–500 ms | 80–200 ms | 100–250 ms |
| OpenVLA (7B) | 7B | 3–10 s | 200–500 ms | 1–3 s (INT4) |
| Octo (93M) | 93M | 30–100 ms | 15–40 ms | 20–60 ms |
量化戦略
量子化により,メモリ足跡を減らすためにモデル精度が低下し,精度に代償を払って推理速度が増加します.
- FP32 → FP16 (半精度): 2×メモリ削減,ほとんどの操作モデルで<1
3%の精度損失.パスカルの後 NVIDIA GPUのすべてにネイティブサポートされています. 端部署のデフォルトとして推奨されています. - FP16 → INT8: さらに2倍メモリ削減,操縦政策に典型的精度損失10
15%. L1 L2タスクでは受け入れられる. L3+精度タスクでは注意深くテストする. Jetson最適化された INT8推論のためにNVIDIA TensorRTを使用する. - FP16 → INT4 (4ビット): 4×削減対 FP16. 15
25%精度低下.主にLLMベースのモデル (OpenVLA) に有用である.言語の脊椎がほとんどのパラメータを表している.Bitsandbytes (NF4形式) またはGPTQを使用する. - TensorRT最適化: 量子化を超えて,TensorRTは動作を融合し,メモリレイアウトを最適化し,ターゲットジェットソンハードウェアの最適化された CUDAカーネルにコンパイルします.しばしばコンボルショナルモデルではFP16量子化に加えて2
4×の追加スピードアップを提供します.
クラウドインフェレンスは: 受け入れられる時
クラウド推理は,遅延許容性がある特定の使用事例において実行可能である.
- 政策選択/タスク計画: 次の低レベルのスキルを実行する高レベルのプランナーが500 ms
2sの遅延を許容できる.これは自然な分割点です.クラウドでVLMベースのプランニングを実行し,低レベルのスキルを端で実行します. - シーン理解: 操作を開始する前にロボットが停止した場合,プレグラスプ計画のためのセマニックシーン分析 (オブジェクト分類,価格推定) はクラウドで実行できます.
- リアルタイムではない遠隔操作監視: ロボットの動作を監視し,異常を検知するクラウドベースの監視システム (直接制御を受けずに) は,遅延を許容します.
費用比較: 1年 TCO
| Approach | Upfront | Ongoing/Year | 1-Year TCO | Notes |
|---|---|---|---|---|
| Jetson AGX Orin (1 robot) | $500–$800 | $0 (owned) | $800 | Carrier board adds $200–400 |
| RTX 4090 workstation (5 robots) | $3,000 | $0 (owned) | $3,000 | $600/robot amortized over 1 year |
| Cloud GPU (A100, on-demand) | $0 | $2,200–$4,400 | $2,200–$4,400 | $0.25–$0.50/hr × 8,760 hr (24/7) |
| Cloud GPU (reserved instance) | $0 | $800–$1,600 | $800–$1,600 | ~50% discount for 1-year reservation |
| Jetson + cloud hybrid | $500–$800 | $400–$800 | $900–$1,600 | Edge for real-time, cloud for training |
端末ハードウェアは24時間営業で決定的に勝利する.GPU利用率が <40% (オンデマンド価格設定) の開発と細かな調整サイクルでクラウドが勝利する.ハイブリッドアプローチは生産推論の
RCSV プラットフォーム は開発と評価のためのクラウド推理エンドポイントを提供し,生産のためのエッジデプロイメントパッケージ (TensorRT, Jetson) を提供します.
ロボット政策のためのエッジとクラウドインフェレンスは
RCSVは政策訓練,エッジデプロイメントパッケージ (TensorRT/Jetson) とクラウド推論エンドポイントを開発に提供します.







