返回Research

云机器人架构2025年模式

云联机器人系统的架构模式 边缘推理,远程运营流,舰队管理和数据管道.

现代机器人系统包括边缘,本地服务器和云. 以下是运行的架构模式以及延迟限制,决定了什么会到哪里.

为什么云+机器人

云计算的经济学使得运行远离物理机器人的大量计算成为实用的,而网络延迟进步 (5G,WiFi 6E) 已经扩大了可行的卸载. 现代机器人部署使用三层次的架构:安全关键的实时控制的机载计算,低延迟推理和本地数据缓冲的边缘服务器,以及模型培训,舰队管理和远程运行继电器的云.

关键的架构原则是: 一切具有时间关键的运行在本地;所有计算密集的运行在云中. 当网络延迟减少和边缘硬件变得更强大时,本地和云之间的界限会改变.

建筑层

层1:机器人上船

机器人机器人机器人执行安全关键,实时任务. 任何影响物理安全的东西都不应该依赖网络连接.

  • ROS 2控制节点: 联合轨迹执行,安全监测,电子停止操作.必须以5001,000Hz的速度运行,升1 ms. 预先_RT内核或Xenomai需要进行确定性定制.
  • 安全控制器: 联合执行限制,碰撞监测,工作场所边界检查.这是最后一条防御线,绝不能被云外包.
  • 地方状态估计: 亲自接受,IMU融合,基层测.这些是任何控制或感知计算的先决条件.
  • 硬件: 大多数协作手臂包括机载控制器 (UR Control Box,Franka FCI).对于移动机器人,NVIDIA Jetson AGX Orin (275 TOPS INT8) 是人工智能增强感知和执行政策的标准边缘模块.

层2:边缘服务器

局部服务器 (位于设施或机器人室) 处理需要GPU加速的计算,但必须保持低于50ms延迟.

  • **政策推断:**运行ACT,扩散政策或OpenVLA精细调化的模型.NVIDIA RTX 4090或A100服务器同时处理520机器人推断流,以50Hz.
  • 本地数据缓冲器: 对于快速检索和重新训练而非云中回路的近期事件 (2448小时运行) 的环保缓冲器.
  • 实时感知: 对象检测,对象估计,对政策输入进行深度处理.
  • 硬件推: 一台工作站级服务器 (NVIDIA A4000或 RTX 4090,64 GB RAM,2 TB NVMe) 处理510机器人集群,硬件价格约为8,00015,000美元.

层3:云

云服务处理耐延迟,计算密集的工作负载和机队规模功能.

  • 模型培训: 基于累积的示范数据的培训或细节调整政策模型.这是云GPU集群的主要使用情况 (AWS p4d,GCP A100 pods,Lambda Labs).
  • 舰队仪表板: 部署中的所有机器人实时监测 吞吐量,错误率,关节健康,任务完成. 延迟耐受性 (秒) 聚合是可接受的.
  • 远程运营者电信: 对于远程运营者电信,云提供STUN/TURN基础设施,用于NAT通道和WebRTC信号.视频和命令流在可能的情况下流向同行;通过云电信,NAT阻止直接连接时.
  • **长期数据湖:**所有事件数据最终流向云对象存储 (S3或GCS) 进行长期存储,培训数据集构建和合规性.
  • **模型服务 (耐延迟任务):**基于VLM的任务规划,自然语言指令分析和场景理解 ,其中3001,000 ms的延迟是可接受的.

按函数的延迟预算

Function Max 延迟 Required Tier Notes
E-stop / safety halt <1 ms Onboard Never cloud-dependent
Joint trajectory execution <5 ms Onboard Hard real-time required
Policy inference (manipulation) 10–50 ms Edge Contact tasks need <20 ms
Object detection / pose 20–80 ms Edge Depends on task speed
遥操作 video stream 30–80 ms Edge / P2P Above 100 ms degrades operator
Task planning (VLM) 300–2,000 ms Cloud 延迟-tolerant planning
Fleet monitoring 1–10 s Cloud Aggregation acceptable
Model training Hours Cloud Async, not latency-sensitive

电操作流流架构

远程机器人远程操作需要双向实时流:视频从机器人到操作员,命令从操作员到机器人.

  • 视频流: WebRTC与H.264或AV1编码器.边缘服务器上的NVENC硬件编码降低编码延迟到<10ms.适应式位速率为1030Mbps针对高清立体视频.
  • 命令流: WebSocket 通过 TLS 运营器控制器构成数据. JSON 或 msgpack 编码. 100 Hz 更新速度.优先排列,以便最新的命令在过渡网络拥堵时取代旧命令.
  • **NAT通行:**STUN (Coturn或管理的STUN服务) 在大多数居民互联网运营商.TURN继电器需要对称NAT或严格的公司防火墙后的运营商.TURN继电器流量预算为0.10美元/GB.
  • 操作员延迟监测: 在耳机HUD中显示操作员的端到端回路延迟. 延迟超过120ms时,警告.

数据管道:机器人到训练集群

  • ** 集集捕获:** 在集集完毕后,边缘服务器将HDF5文件 (观察+行动+元数据) 写入本地NVMe缓冲器.
  • 背景上传: 一个恶魔监控本地缓冲器,并通过多部份上传完成的集锦上传到S3/GCS.带宽限制以避免干扰机器人操作.典型的集锦大小:100500MB.
  • **摄入验证:**云端的Lambda/Cloud Function在每个上传的集中运行了方案验证和自动质量检查 (见[质量指标文章]T1)) 失败的集将被隔离到一个审查队列.
  • **训练触发器:**当一个新的批量验证的集段可用时,数据集版本会被标签. 这会在新数据的使用下触发GPU集群上训练任务.
  • 模型更新OTA: 训练完成后,新模型通过OTA更新系统被推到边缘服务器.

云提供商的比较

Provider Robot-Specific Service GPU Options IoT Integration Best For
AWS AWS IoT Greengrass, RoboMaker p4d, p3, g4dn AWS IoT Core, Greengrass Enterprise, broad ecosystem
GCP None (general compute) A100, H100, TPUv4 Cloud IoT Core (deprecated) ML training, BigQuery analytics
Azure Azure IoT Hub, Digital Twins NC A100, ND H100 IoT Hub, IoT Edge Microsoft enterprise, mixed reality
Custom (Lambda Labs) None A100, H100 on-demand N/A GPU-only cost optimization

RCSV [平台]T2) 提供了管理实现这种架构的边缘代理机器人侧数据收集,云管道处理事件,以及网络仪表板监控机队,而无需团队从零开始构建基础设施.

部署云机器人基础设施

服务器的管理方式: 系统的监控,数据管道和模型培训,

探索平台 →