返回Research

实时机器人推理:边缘与云架构交易

机器人政策推断在边缘与云 <unk>延迟分析,硬件选项,模型量化和成本比较.

您的机器人政策的推断架构决定了您可以运行哪些模型,

按任务类型的延迟要求

在选择推理架构之前,您需要对任务进行精确的延迟要求.所需的延迟由机器人的控制频率和操纵的性质设定:

  • **自由空间运动 (臂向目标移动):**50100ms推理延迟可接受.臂在接近阶段以低速度移动,并且100ms的停滞政策查询不会导致位置错误超过任务容量.
  • **接触丰富的操纵 (插入,组装):**需要1020ms的推理延迟.在接触时,小状态变化 (0.51mm位置错误) 可能导致任务失败,因此该政策必须经常重新查询以保持分布.
  • 反应式抓取 (移动物体,输送器): <50 ms 需要. 政策查询之间物体位置正在变化;过时查询导致系统错误.
  • 安全关键停止: <1 ms. 这完全不能依赖于政策推断循环,必须由机器人的安全控制器处理.

边缘硬件选项

边缘推断硬件与机器人同时运行,从而消除了网络回路延迟. 折衷是更高的初始成本和本地维护责任.

Hardware TOPS (INT8) Price Power Form Factor Best For
NVIDIA Jetson AGX Orin 64GB 275 TOPS $499 (module) 15–60W Embedded module Full policy inference at edge
NVIDIA Jetson Orin NX 16GB 100 TOPS $299 (module) 10–25W Embedded module Smaller models, power-constrained
NVIDIA RTX 4090 (workstation) ~1,600 TOPS (FP16) $1,600 450W TDP Desktop PCIe Large model inference, multiple robots
Intel NUC with Arc GPU ~40 TOPS $600–$900 35W Mini PC Simple BC policies, low cost
Raspberry Pi 5 ~5 TOPS $80 5–10W SBC 多层感知器 policies only, very simple tasks

在执行ACT或扩散政策的操作任务中,NVIDIA Jetson AGX Orin是最好的边缘硬件.其275TOPS INT8性能处理ACT推理在3080ms和量化扩散在2050ms.

模型大小与推理延迟

Model Parameters Edge (Jetson AGX) Cloud (A100) Quantized INT8 Edge
BC (多层感知器 policy) ~1M 1–3 ms <1 ms 1–2 ms
ACT (original) ~84M 50–100 ms 15–30 ms 20–50 ms (FP16)
Diffusion Policy (U-Net) ~100M 30–80 ms 10–30 ms 20–50 ms
Diffusion Policy (Transformer) ~300M 200–500 ms 80–200 ms 100–250 ms
OpenVLA (7B) 7B 3–10 s 200–500 ms 1–3 s (INT4)
Octo (93M) 93M 30–100 ms 15–40 ms 20–60 ms

量化策略

量化降低模型精度,以减少记忆足迹,并提高推理速度,以成本对准确性:

  • FP32 → FP16 (半精度): 2x 内存减少,在大多数操纵模型上损失精度<13%.自帕斯卡以来所有NVIDIA GPU上都支持本土.作为边缘部署的默认建议.
  • FP16 → INT8: 进一步的2x内存减少,对操纵策略的准确性损失为1015%.可接受L1L2任务;对L3+准确性任务进行仔细测试.使用NVIDIA TensorRT来推断Jetson优化的INT8.
  • FP16 → INT4 (4位): 4×降低对 FP16. 1525%的精度损失.主要适用于基于LLM的模型 (OpenVLA) 语言背骨代表大多数参数.使用位数和字节 (NF4格式) 或GPTQ.
  • TensorRT优化: 除了量化之外,TensorRT将操作结合起来,优化了内存布局,并对目标Jetson硬件进行了优化的CUDA内核编译.

云线性:当它是可接受的

云推理可用于存在延迟容忍的特定使用情况:

  • **政策选择/任务规划:**一个高层次的规划器选择下一步执行哪些低层次技能可以容忍500 ms2s的延迟.这是一个自然的分区点:在云中运行基于VLM的规划,在边缘执行低层次技能.
  • **场景理解:**如果机器人在开始操作之前停下来,对于预抓计划的语义场景分析 (对象分类,价格估计) 可以在云中运行.
  • 非实时远程操作监测: 基于云的监测系统,监测机器人的操作,并标记异常 (不直接控制) 能够容忍任何延迟.

成本比较:一年的TCO

Approach Upfront Ongoing/Year 1-Year TCO Notes
Jetson AGX Orin (1 robot) $500–$800 $0 (owned) $800 Carrier board adds $200–400
RTX 4090 workstation (5 robots) $3,000 $0 (owned) $3,000 $600/robot amortized over 1 year
Cloud GPU (A100, on-demand) $0 $2,200–$4,400 $2,200–$4,400 $0.25–$0.50/hr × 8,760 hr (24/7)
Cloud GPU (reserved instance) $0 $800–$1,600 $800–$1,600 ~50% discount for 1-year reservation
Jetson + cloud hybrid $500–$800 $400–$800 $900–$1,600 Edge for real-time, cloud for training

边缘硬件在24小时运行中很明显获胜.云在开发和调整周期中获胜,GPU利用率为40% (按需定价).混合方法为生产推断边缘,云在定期重训提供了两者中最好的.

对于开发和评估,RCSV [平台]T1) 提供了一个云推断终点,以及生产的边缘部署包装 (TensorRT,Jetson).

机器人政策的边缘和云计算

提供政策培训,边缘部署包装 (TensorRT/Jetson),以及云推断终点.

探索平台 →