Volver a Guides

Gestión remota de la flota de robots: monitoreo, diagnóstico y operaciones

Cómo gestionar a distancia a escala a los robots <unk> telemetría, actualizaciones de OTA, acceso remoto, respuesta a incidentes y seguimiento de KPI.

[← Guías]

Una guía práctica de operaciones para equipos que ejecutan de 5 a 500 robots en múltiples sitios que cubre toda la pila desde la telemetría hasta las actualizaciones de OTA.

Componentes de la pila de gestión de la flota

Un sistema de gestión de flotas de grado de producción tiene cinco componentes esenciales. La mayoría de los equipos construyen estos incrementalmente, comenzando con la telemetría y el acceso remoto, luego añaden el sistema de actualización y alerta a medida que la flota se expande más allá de 10 robots.

  • Registro de dispositivos: Una base de datos de todos los robots de la flota número de serie, modelo, versión de firmware, ubicación, operador asignado y estado actual. Esta es la fuente de verdad para todos los demás sistemas. Funciona una simple tabla PostgreSQL; soluciones especialmente construidas como AWS IoT o Azure IoT Hub proporcionan esto a escala.
  • Telemetría de tubería: Transmitir métricas de robot a la nube. típicamente MQTT o gRPC del robot, ingerido en una base de datos de serie de tiempo (InfluxDB o TimescaleDB). Meta <10 segundos de latencia para métricas operativas, <1 segundo para señales críticas para la seguridad.
  • Capa de acceso remoto: Acceso autenticado para operadores e ingenieros para inspeccionar y controlar robots sin presencia física. Discutido en detalle en la sección Métodos de acceso remoto.
  • ** Sistema de actualización OTA:** Mecanismo para impulsar las actualizaciones de firmware, software y políticas a los robots en el campo.
  • Alerta y llamada: Detección automática de anomalías con escalada a ingenieros en llamada.

Telemetría para recoger

La telemetría excesiva aumenta los costos y crea ruido.

  • ** Temperaturas de las articulaciones:** Temperatura del motor por articulación en °C. Alerta a 70 °C (alerta), parada de emergencia a 85 °C. Temperatura elevada es un indicador temprano de aumento de la fricción, falla inminente del rodamiento o perfiles de tareas sobrecargados.
  • ** Códigos de error conjuntos:** Cualquier código de error del conductor del motor, registrado con timestamp y ID conjunta.
  • Estado de carga y voltaje de la batería: % de la batería y voltaje a intervalos de 1 minuto.
  • Rata de éxito/fallo de tareas: Resultado por episodio con tipo de tarea, duración y modo de falla.
  • **Latencia de red:**Latencia de ida y vuelta del robot a la nube a intervalos de 30 segundos.
  • ** Salud de la cámara:** Rate de fotogramas y número de fotogramas caídos por cámara.

Infraestructura de seguimiento

La pila de monitoreo de código abierto estándar funciona bien para flotas de robots de hasta ~ 200 unidades:

  • ** Prometheus + Grafana:** Prometheus raspa los puntos finales de métricas expuestos por el agente de la flota de cada robot a intervalos de 15 segundos. Grafana visualiza los tableros de control a nivel de flota: tiempo de actividad total, salud por robot, rendimiento de tareas y historial de alertas.
  • InfluxDB: Para la telemetría de alta frecuencia (posiciones conjuntas a 100 Hz), utilice la compresión de serie temporal de InfluxDB en lugar de Prometheus (que no está optimizada para datos de alta cardinalidad y alta frecuencia).
  • PagerDuty: Gerencia las rotaciones en llamadas y la escalada de las alertas. Integra Prometheus alertmanager → PagerDuty para la creación automática de incidentes. Define políticas de escalada separadas para las alertas de seguridad (página inmediata) frente a las alertas de mantenimiento (horario de trabajo solo).
  • Tabla de control de salud de la flota personalizada: Construir una vista de control de misión de pantalla única en [la plataforma]T5) que muestre: mapa de todas las ubicaciones de los robots con indicadores de estado, las cinco principales tareas fallidas, el porcentaje de tiempo de actividad de la flota y los robots que requieren mantenimiento.

Métodos de acceso remoto

Method Latencia Security Best For
SSH over VPN (WireGuard) 20–80ms depending on VPN server location High — key-based auth, encrypted tunnel Engineering diagnostics, log review, config changes
WebRTC remote desktop 50–150ms Medium — requires signaling server security Operator GUI access, rviz2 visualization
ROS2 bridge (rosbridge_suite) 30–100ms Low by default — add TLS + auth explicitly Programmatic telemetry access, remote monitoring scripts

WireGuard VPN es la base recomendada para todo acceso remoto. Implemente un servidor WireGuard (por ejemplo, en una gota DigitalOcean de $ 5 / mes) y configure cada robot como un cliente WireGuard con un par de teclas único. Todo el acceso remoto se realiza a través del túnel VPN SSH, paneles de control web y tráfico de puente ROS2 están todos tunelados, eliminando la necesidad de exponer cualquier puerto de robot directamente a Internet.

Los límites de alerta

Metric Warning Threshold Emergency Threshold Automated Action
Joint temperature >70°C >85°C Emergency: immediate e-stop
Task success rate (7-day rolling) <80% <60% Emergency: suspend policy, alert on-call
Battery SoC <20% <10% Emergency: return to charger or alert operator
Network latency (robot→cloud) >200ms >500ms Warning: log; Emergency: disable teleoperation
Camera frame drop rate >5% >20% Warning: log; Emergency: pause data collection
Consecutive task failures 3 in a row 5 in a row Warning: operator alert; Emergency: suspend + escalate

Proceso de actualización de la OTA

Las actualizaciones en el aire son la forma en que se envían mejoras y correcciones de seguridad a los robots desplegados sin visitas al sitio.

  • Construir: Cada actualización (firmware, software o política) se construye en CI y produce un artefacto versionado con una suma de comprobación sha256.
  • ** Prueba de fase:** Antes de cualquier implementación en el campo, la actualización se aplica a 23 robots de fase en el laboratorio y se valida con una suite de pruebas automatizadas de 50 ensayos.
  • Rollout Canary (10%): Despliegue en el 10% de la flota (o un mínimo de 3 robots) durante 48 horas.
  • Rollout completo: Si las métricas canarias son nominales, desplegarse en la flota restante.
  • ** Capacidad de retroalimentación:** Cada robot mantiene el artefacto de la versión anterior localmente.

Indicadores clave de la flota

KPI Definition Target Measurement Interval
MTBF (Mean Time Between Failures) Average operating hours between unplanned stoppages >200 hours Monthly
MTTR (Mean Time to Repair) Average time from incident detection to resumed operation <2 hours Monthly
Fleet uptime % of scheduled operating hours spent in active operation >95% Weekly
Task completion rate % of tasks completed successfully without human intervention >90% Daily
OTA update success rate % of update deployments that succeed without rollback >99% Per-release

Opciones de conectividad: comparación detallada

Option Typical Latencia Bandwidth Cost/Robot/Month Best For
WireGuard VPN over WiFi 20-80 ms 100+ Mbps $5 (VPN server) Lab and warehouse with existing WiFi
WireGuard VPN over 5G 15-40 ms 100-500 Mbps $30-$80 (data plan) Mobile robots, outdoor, no WiFi available
Tailscale (managed WireGuard) 20-80 ms 100+ Mbps $0-$18/device Quick setup, NAT traversal, SSO integration
WebRTC peer-to-peer 50-150 ms 10-50 Mbps $0 (STUN/TURN server) Browser-based remote viewing, video streams
Wired Ethernet (on-premise) <1 ms 1 Gbps $0 (existing infra) Fixed arm installations, highest reliability

Para la mayoría de las implementaciones, la arquitectura recomendada es: ** Ethernet cableado para el robot LAN** (controller de brazo a estación de trabajo), ** WireGuard VPN para acceso remoto** (ordenador portátil de ingeniero a robot), y ** WiFi o 5G para la carga de telemetría en la nube**. Esto proporciona latencia de submillisecondas para el bucle de control al tiempo que permite el acceso remoto seguro.

Detección de fallas y recuperación automática

Un sistema de gestión de flotas bien diseñado se recupera de los fallos comunes sin intervención humana, reduciendo el MTTR de horas a minutos:

  • Timer de vigilancia: El agente de flota a bordo envía un latido cardíaco cada 10 segundos. Si el gerente de flota no recibe latido cardíaco durante 30 segundos, marca al robot como "inalcanzable" y activa una secuencia de diagnóstico de red (ping, traceroute, verificación DNS).
  • Reinicio automático del proceso: Utilice unidades de servicio de sistemad para todo el software del robot (lanzamiento deROS2, agente de flota, controladores de cámara). Configure T0 con T1. Esto se recupera de los accidentes del proceso (fallas seg, OOM mata) automáticamente. Registre cada evento de reinicio en la tubería de telemetría.
  • ** Recuperación de la cámara:** Las cámaras USB caen ocasionalmente del autobús. El agente de la flota monitorea los nodos del dispositivo T2. Si una cámara desaparece, el agente ejecuta T3 en el puerto, espera 3 segundos y verifica que la cámara vuelve a aparecer. Si no después de 3 intentos, alerta al operador para una inspección física.
  • ** Fallo de red:** Para los robots con conectividad WiFi y celular, configure fallo automático: si la latencia WiFi supera los 200 ms durante 30 segundos, cambie el tráfico de telemetría y API a la copia de seguridad celular.
  • Gestión del espacio en disco: La recopilación de datos HDF5 puede llenar rápidamente los discos (3 cámaras a 30 fps = ~ 50 GB/hora). El agente de flota monitorea el uso del disco y transfiere automáticamente los episodios completos al almacenamiento en la nube o NAS cuando el disco excede el 70%.

Integración de la plataforma RCSV

La plataforma RCSV proporciona una capa de gestión de flotas gestionada que elimina la necesidad de construir una infraestructura de monitoreo personalizada:

  • Tablero de control de la flota: Mapa en tiempo real de todas las ubicaciones de los robots con indicadores de estado (verde/amarillo/rojo). Haz clic en cualquier robot para ver la telemetría en vivo, las imágenes de la cámara y el historial de las tareas.
  • Telemetría de la tubería: Los robots envían métricas a través de MQTT a la plataforma de influxDB backend.
  • ** Administrador de actualizaciones de OTA:** Subir nuevos firmware, software o artefactos de políticas a la plataforma.
  • Enrutamiento de alertas: Configurar las reglas de alerta (detección de anomalías basadas en umbral) con enrutamiento a correo electrónico, Slack, PagerDuty o al sistema de notificación integrado de la plataforma.

Guías relacionados

  • Guía de integración de las API de robots -- Modelos de API para la comunicación de la flota
  • [Disposición de la política a la producción] T8) -- despliegue y supervise las políticas en toda una flota
  • [Plan de mantenimiento preventivo]T9) -- Planificación del mantenimiento de las operaciones de la flota
  • [Evaluación de riesgos para la seguridad de los robots]T10) -- Requisitos de seguridad para las instalaciones distribuidas de flotas
  • [Lista de control de la implementación de los almacenes]T11) -- Despliegue de la flota en entornos de producción

Trabajar con el RCSV

El RCSV proporciona infraestructura de gestión de flotas para el despliegue de robots de cualquier escala.

  • Plataforma de datos -- tablero de control de flota administrado, telemetría, actualizaciones de OTA y enrutamiento de alertas
  • Reparación y mantenimiento -- diagnóstico remoto y servicio in situ para robots de flota
  • Robot Leasing -- arrendar robots listos para la flota con agentes de gestión de flota preinstalados
  • [Contacta con nosotros] T15) -- solicitar una revisión de la arquitectura de la flota para su despliegue

Gestionar su flota desde un solo tablero

La plataforma RCSV proporciona telemetría de flota, gestión de actualizaciones de OTA y acceso remoto para operadores de robots a cualquier escala.

[Explora la plataforma]