Volver a Research

Modelos de arquitectura de robótica en la nube para 2025

Modelos de arquitectura para sistemas de robots conectados a la nube <unk> inferencia de borde, transmisión de teleoperaciones, gestión de flotas y tuberías de datos.

[← Investigación]

Los sistemas modernos de robots abarcan el borde, los servidores locales y la nube. Aquí están los patrones de arquitectura que funcionan y las restricciones de latencia que determinan qué va a dónde.

¿Por qué la nube + robot

La economía de la computación en la nube ha hecho práctico ejecutar una computación sustancial lejos del robot físico, mientras que los avances en la latencia de la red (5G, WiFi 6E) han ampliado lo que es factible descargar. Las implementaciones modernas de robots utilizan una arquitectura de tres niveles: computación a bordo para el control en tiempo real crítico para la seguridad, servidores de borde para inferencia de baja latencia y amortiguamiento de datos locales, y la nube para el entrenamiento de modelos, gestión de flotas y teleoperación.

El principio arquitectónico clave es: todo lo que es crítico en el tiempo se ejecuta localmente; todo lo que es intenso en computación se ejecuta en la nube. El límite entre local y nube cambia a medida que la latencia de la red disminuye y el hardware de borde se vuelve más potente.

Capas de arquitectura

Capas 1: Robot a bordo

La computadora de bordo del robot ejecuta tareas difíciles en tiempo real y críticas para la seguridad. Nada que afecte a la seguridad física debe depender de la conectividad de la red.

  • Nodo de control de ROS 2: Ejecución de trayectoria conjunta, monitoreo de seguridad, manejo de parada electrónica. Debe ejecutarse a 5001,000 Hz con un jitter de <1 ms.
  • Controller de seguridad: Control conjunto de límites, monitoreo de colisiones, controles de límites del espacio de trabajo. Esta es la última línea de defensa y nunca debe ser externalizada a la nube.
  • Estimación del estado local: Propriocepción, fusión de la UMI, odometría de base.
  • Hardware: La mayoría de los brazos de colaboración incluyen un controlador a bordo (UR Control Box, Franka FCI). Para robots móviles, NVIDIA Jetson AGX Orin (275 TOPS INT8) es el módulo de borde estándar para la percepción y ejecución de políticas mejoradas por IA.

Capas 2: servidor de borde

Un servidor local (co-ubicado en la instalación o en la sala de robots) maneja el cálculo que requiere aceleración de la GPU pero debe permanecer por debajo de ~ 50 ms de latencia.

  • Inferencia de política: Ejecutar ACT, política de difusión o modelos de OpenVLA afinados. Un servidor NVIDIA RTX 4090 o A100 maneja 520 flujos de inferencia de robot simultáneamente a 50 Hz.
  • Buffer de datos locales: Buffer de anillos de episodios recientes (2448 horas de operación) para recuperación rápida y reentrenamiento sin viajes de ida y vuelta en la nube. NVMe RAID recomendado para el rendimiento de escritura.
  • Percepción en tiempo real: Detección de objetos, estimación de posiciones, procesamiento de profundidad para las entradas de políticas.
  • ** Recomendación de hardware:** Un servidor de clase de estación de trabajo (NVIDIA A4000 o RTX 4090, 64 GB de RAM, 2 TB de NVMe) maneja un grupo de robots 510 a aproximadamente $8,000$15,000 en hardware.

Capas 3: Nube

Los servicios en la nube manejan cargas de trabajo de alta capacidad de latencia y de alta intensidad informática y funciones a escala de flota.

  • ** Formación de modelos:** Formación o ajuste de modelos de política sobre datos de demostración acumulados. Este es el caso de uso principal para los grupos de GPU en la nube (AWS p4d, GCP A100 pods, Lambda Labs).
  • Tablero de control de flota: Monitoreo en tiempo real de todos los robots en una implementación rendimiento, tasas de error, salud de las articulaciones, finalización de tareas.
  • ** Teleoperación de relevo:** Para la teleoperación de operadores remotos, la nube proporciona la infraestructura STUN/TURN para la navegación NAT y la señalización WebRTC.
  • ** Lago de datos a largo plazo:** Todos los datos de los episodios eventualmente fluyen al almacenamiento de objetos en la nube (S3 o GCS) para la retención a largo plazo, la formación en la construcción de conjuntos de datos y el cumplimiento.
  • Servidor de modelo (tareas tolerantes a la latencia): Planificación de tareas basada en VLM, análisis de instrucciones de lenguaje natural y comprensión de escena donde se acepta una latencia de 3001,000 ms.

Presupuesto de latencia por función

Function Max Latencia Required Tier Notes
E-stop / safety halt <1 ms Onboard Never cloud-dependent
Joint trajectory execution <5 ms Onboard Hard real-time required
Policy inference (manipulation) 10–50 ms Edge Contact tasks need <20 ms
Object detection / pose 20–80 ms Edge Depends on task speed
Teleoperación video stream 30–80 ms Edge / P2P Above 100 ms degrades operator
Task planning (VLM) 300–2,000 ms Cloud Latencia-tolerant planning
Fleet monitoring 1–10 s Cloud Aggregation acceptable
Model training Hours Cloud Async, not latency-sensitive

Arquitectura de transmisión de teleoperaciones

La teleoperación remota del robot requiere transmisión bidireccional en tiempo real: vídeo de robot a operador, comandos de operador a robot.

  • Reacción de vídeo: WebRTC con H.264 o codec AV1. La codificación de hardware NVENC en el servidor de borde reduce la latencia de codificación a <10 ms. La velocidad de bits adaptativa dirigida a 1030 Mbps para el vídeo estéreo HD.
  • ** Flujo de comandos:** WebSocket sobre TLS para el controlador del operador posee datos. codificación JSON o msgpack. Rata de actualización de 100 Hz. Cuadra de prioridad para que los comandos más recientes desplacen los antiguos durante la congestión transitoria de la red.
  • NAT cruce: STUN (Coturn o servicio STUN administrado) para la mayoría de los operadores en Internet residencial. Relé TURN requerido para los operadores detrás de NAT simétricos o paredes de seguridad corporativas estrictas. Presupuesto ~ $0.10 / GB para el tráfico de relé TURN.
  • ** Monitoreo de latencia del operador:** Muestre la latencia de ida y vuelta de extremo al operador en el auricular HUD. Alerta cuando la latencia excede los 120 ms este es el umbral en el que muchos operadores encuentran la manipulación incómodamente imprecisa.

Pipeline de datos: robot a grupo de entrenamiento

  • ** Captura de episodios:** Al finalizar el episodio, el servidor de borde escribe un archivo HDF5 (observaciones + acciones + metadatos) en el buffer NVMe local.
  • ** Subida de fondo:** Un demonio monitoriza el buffer local y subirá los episodios completos a S3/GCS utilizando subida de múltiples partes.
  • ** Validación de ingesta:** Lambda/Cloud Function de lado en la nube ejecuta validación de esquema y controles de calidad automatizados (ver [artículo de métricas de calidad] T1)) en cada episodio subido. Los episodios fallidos se encuentran en cuarentena en una cola de revisión.
  • Trigger de capacitación: Una versión de conjunto de datos se etiqueta cuando se dispone de un nuevo lote de episodios validados. Esto activa un trabajo de capacitación en el grupo de GPU utilizando los nuevos datos.
  • ** Actualización del modelo OTA:** Después de que se complete la formación y se apruebe la evaluación fuera de línea, el nuevo modelo se empuja a los servidores de borde a través de un sistema de actualización OTA.

Comparación de proveedores de nube

Provider Robot-Specific Service GPU Options IoT Integration Best For
AWS AWS IoT Greengrass, RoboMaker p4d, p3, g4dn AWS IoT Core, Greengrass Enterprise, broad ecosystem
GCP None (general compute) A100, H100, TPUv4 Cloud IoT Core (deprecated) ML training, BigQuery analytics
Azure Azure IoT Hub, Digital Twins NC A100, ND H100 IoT Hub, IoT Edge Microsoft enterprise, mixed reality
Custom (Lambda Labs) None A100, H100 on-demand N/A GPU-only cost optimization

El RCSV [plataforma]T2) proporciona una implementación gestionada de esta arquitectura agentes de borde para la recopilación de datos del lado del robot, una tubería en la nube para el procesamiento de episodios y un panel de control web para el monitoreo de flotas sin que los equipos necesiten construir infraestructura desde cero.

Implementación de la infraestructura de robótica en la nube

La plataforma RCSV proporciona infraestructura de robótica en la nube gestionada: monitoreo de flota, tuberías de datos y capacitación de modelos conectados a su implementación de robots existentes.

Explora la plataforma →