实时机器人推理:边缘与云架构交易
机器人政策推断在边缘与云 <unk>延迟分析,硬件选项,模型量化和成本比较.
您的机器人政策的推断架构决定了您可以运行哪些模型,
按任务类型的延迟要求
在选择推理架构之前,您需要对任务进行精确的延迟要求.所需的延迟由机器人的控制频率和操纵的性质设定:
- **自由空间运动 (臂向目标移动):**50
100ms推理延迟可接受.臂在接近阶段以低速度移动,并且100ms的停滞政策查询不会导致位置错误超过任务容量. - **接触丰富的操纵 (插入,组装):**需要10
20ms的推理延迟.在接触时,小状态变化 (0.5 1mm位置错误) 可能导致任务失败,因此该政策必须经常重新查询以保持分布. - 反应式抓取 (移动物体,输送器): <50 ms 需要. 政策查询之间物体位置正在变化;过时查询导致系统错误.
- 安全关键停止: <1 ms. 这完全不能依赖于政策推断循环
,必须由机器人的安全控制器处理.
边缘硬件选项
边缘推断硬件与机器人同时运行,从而消除了网络回路延迟. 折衷是更高的初始成本和本地维护责任.
| Hardware | TOPS (INT8) | Price | Power | Form Factor | Best For |
|---|---|---|---|---|---|
| NVIDIA Jetson AGX Orin 64GB | 275 TOPS | $499 (module) | 15–60W | Embedded module | Full policy inference at edge |
| NVIDIA Jetson Orin NX 16GB | 100 TOPS | $299 (module) | 10–25W | Embedded module | Smaller models, power-constrained |
| NVIDIA RTX 4090 (workstation) | ~1,600 TOPS (FP16) | $1,600 | 450W TDP | Desktop PCIe | Large model inference, multiple robots |
| Intel NUC with Arc GPU | ~40 TOPS | $600–$900 | 35W | Mini PC | Simple BC policies, low cost |
| Raspberry Pi 5 | ~5 TOPS | $80 | 5–10W | SBC | 多层感知器 policies only, very simple tasks |
在执行ACT或扩散政策的操作任务中,NVIDIA Jetson AGX Orin是最好的边缘硬件.其275TOPS INT8性能处理ACT推理在30
模型大小与推理延迟
| Model | Parameters | Edge (Jetson AGX) | Cloud (A100) | Quantized INT8 Edge |
|---|---|---|---|---|
| BC (多层感知器 policy) | ~1M | 1–3 ms | <1 ms | 1–2 ms |
| ACT (original) | ~84M | 50–100 ms | 15–30 ms | 20–50 ms (FP16) |
| Diffusion Policy (U-Net) | ~100M | 30–80 ms | 10–30 ms | 20–50 ms |
| Diffusion Policy (Transformer) | ~300M | 200–500 ms | 80–200 ms | 100–250 ms |
| OpenVLA (7B) | 7B | 3–10 s | 200–500 ms | 1–3 s (INT4) |
| Octo (93M) | 93M | 30–100 ms | 15–40 ms | 20–60 ms |
量化策略
量化降低模型精度,以减少记忆足迹,并提高推理速度,以成本对准确性:
- FP32 → FP16 (半精度): 2x 内存减少,在大多数操纵模型上损失精度<1
3%.自帕斯卡以来所有NVIDIA GPU上都支持本土.作为边缘部署的默认建议. - FP16 → INT8: 进一步的2x内存减少,对操纵策略的准确性损失为10
15%.可接受L1 L2任务;对L3+准确性任务进行仔细测试.使用NVIDIA TensorRT来推断Jetson优化的INT8. - FP16 → INT4 (4位): 4×降低对 FP16. 15
25%的精度损失.主要适用于基于LLM的模型 (OpenVLA) 语言背骨代表大多数参数.使用位数和字节 (NF4格式) 或GPTQ. - TensorRT优化: 除了量化之外,TensorRT将操作结合起来,优化了内存布局,并对目标Jetson硬件进行了优化的CUDA内核编译.
云线性:当它是可接受的
云推理可用于存在延迟容忍的特定使用情况:
- **政策选择/任务规划:**一个高层次的规划器选择下一步执行哪些低层次技能可以容忍500 ms
2s的延迟.这是一个自然的分区点:在云中运行基于VLM的规划,在边缘执行低层次技能. - **场景理解:**如果机器人在开始操作之前停下来,对于预抓计划的语义场景分析 (对象分类,价格估计) 可以在云中运行.
- 非实时远程操作监测: 基于云的监测系统,监测机器人的操作,并标记异常 (不直接控制) 能够容忍任何延迟.
成本比较:一年的TCO
| Approach | Upfront | Ongoing/Year | 1-Year TCO | Notes |
|---|---|---|---|---|
| Jetson AGX Orin (1 robot) | $500–$800 | $0 (owned) | $800 | Carrier board adds $200–400 |
| RTX 4090 workstation (5 robots) | $3,000 | $0 (owned) | $3,000 | $600/robot amortized over 1 year |
| Cloud GPU (A100, on-demand) | $0 | $2,200–$4,400 | $2,200–$4,400 | $0.25–$0.50/hr × 8,760 hr (24/7) |
| Cloud GPU (reserved instance) | $0 | $800–$1,600 | $800–$1,600 | ~50% discount for 1-year reservation |
| Jetson + cloud hybrid | $500–$800 | $400–$800 | $900–$1,600 | Edge for real-time, cloud for training |
边缘硬件在24小时运行中很明显获胜.云在开发和调整周期中获胜,GPU利用率为40% (按需定价).混合方法为生产推断
对于开发和评估,RCSV [平台]
机器人政策的边缘和云计算
提供政策培训,边缘部署包装 (TensorRT/Jetson),以及云推断终点.







