Volver a Research

Inferencia de robots en tiempo real: Edge vs. Arquitectura en la nube Tradeoffs

Cuando ejecutar la inferencia de políticas de robots en el borde vs. nube <unk> análisis de latencia, opciones de hardware, cuantización de modelos y comparación de costos.

[← Investigación]

La arquitectura de inferencia de su política de robots determina qué modelos puede ejecutar, a qué costo, con qué garantías de latencia.

Requisitos de latencia por tipo de tarea

Antes de elegir la arquitectura de inferencia, necesita un requisito preciso de latencia para su tarea. La latencia requerida se establece por la frecuencia de control del robot y la naturaleza de la manipulación:

  • Movimiento en espacio libre (brazo que se mueve hacia un objetivo): 50100 ms de latencia de inferencia es aceptable. El brazo se mueve a baja velocidad durante las fases de aproximación, y una consulta de política de 100 ms de estabilidad no causa errores de posicionamiento por encima de la tolerancia de tarea.
  • ** Manipulación rica en contactos (inserción, ensamblaje):** Se requiere una latencia de inferencia de 1020 ms. En el momento del contacto, pequeños cambios de estado (0,51 mm error de posición) pueden causar la falla de la tarea, y la política debe volver a solicitar con frecuencia para mantenerse en distribución.
  • Gestión reactiva (objeto en movimiento, transportador): < 50 ms requeridos. La posición del objeto cambia entre las consultas de política; las consultas obsoletas conducen a errores sistemáticos.
  • Permisa crítica de seguridad: < 1 ms. Esto no puede depender en absoluto del ciclo de inferencia de la política debe ser manejado por un controlador de seguridad dedicado en el robot.

Opciones de hardware de borde

El hardware de inferencia de borde se ejecuta en co-ubicación con el robot, eliminando la latencia de red de ida y vuelta.

Hardware TOPS (INT8) Price Power Form Factor Best For
NVIDIA Jetson AGX Orin 64GB 275 TOPS $499 (module) 15–60W Embedded module Full policy inference at edge
NVIDIA Jetson Orin NX 16GB 100 TOPS $299 (module) 10–25W Embedded module Smaller models, power-constrained
NVIDIA RTX 4090 (workstation) ~1,600 TOPS (FP16) $1,600 450W TDP Desktop PCIe Large model inference, multiple robots
Intel NUC with Arc GPU ~40 TOPS $600–$900 35W Mini PC Simple BC policies, low cost
Raspberry Pi 5 ~5 TOPS $80 5–10W SBC MLP policies only, very simple tasks

Para la mayoría de las tareas de manipulación que ejecutan ACT o política de difusión, el NVIDIA Jetson AGX Orin es el hardware de borde de elección.

Tamaño del modelo vs. Latencia de inferencia

Model Parameters Edge (Jetson AGX) Cloud (A100) Quantized INT8 Edge
BC (MLP policy) ~1M 1–3 ms <1 ms 1–2 ms
ACT (original) ~84M 50–100 ms 15–30 ms 20–50 ms (FP16)
Diffusion Policy (U-Net) ~100M 30–80 ms 10–30 ms 20–50 ms
Diffusion Policy (Transformer) ~300M 200–500 ms 80–200 ms 100–250 ms
OpenVLA (7B) 7B 3–10 s 200–500 ms 1–3 s (INT4)
Octo (93M) 93M 30–100 ms 15–40 ms 20–60 ms

Estrategias de cuantificación

La cuantificación reduce la precisión del modelo para reducir la huella de memoria y aumentar la velocidad de inferencia, a un costo de la precisión:

  • FP32 → FP16 (medio precisión): 2x reducción de memoria, <13% pérdida de precisión en la mayoría de los modelos de manipulación. Soportado nativo en todas las GPU de NVIDIA desde Pascal. Recomendado como predeterminado para la implementación de borde.
  • FP16 → INT8: Más 2 veces reducción de la memoria, 1015% de pérdida de precisión típico de las políticas de manipulación. Acceptable para las tareas L1L2; prueba cuidadosamente para las tareas de precisión L3+. Utilice NVIDIA TensorRT para la inferencia INT8 optimizada por Jetson.
  • FP16 → INT4 (4-bit): 4x reducción vs FP16. 1525% pérdida de precisión. Es especialmente útil para modelos basados en LLM (OpenVLA) donde la columna vertebral del lenguaje representa la mayoría de los parámetros.
  • ** Optimización de TensorRT:** Más allá de la cuantización, TensorRT fusiona operaciones, optimiza el diseño de memoria y compila a núcleos CUDA optimizados para el hardware Jetson objetivo. A menudo proporciona 24x de velocidad adicional en la parte superior de la cuantización FP16 para modelos convolucionales.

Inferencia en la nube: cuando es aceptable

La inferencia en la nube es viable para casos de uso específicos en los que existe tolerancia a la latencia:

  • ** Selección de políticas / planificación de tareas:** Un planificador de alto nivel que seleccione qué habilidades de bajo nivel ejecutar a continuación puede tolerar una latencia de 500 ms2 s. Este es un punto de división natural: ejecutar la planificación basada en VLM en la nube, ejecutar habilidades de bajo nivel en el borde.
  • ** Entendimiento de la escena:** El análisis semántico de la escena (clasificación de objetos, estimación de la oferta) para la planificación pre-grap puede ejecutarse en la nube si el robot se detiene antes de iniciar la manipulación.
  • Monitoreo de la teleoperación en tiempo no real: Un sistema de monitoreo basado en la nube que vigila el funcionamiento del robot y señala anomalías (sin tomar control directo) tolera cualquier latencia.

Comparación de costes: 1 año de TCO

Approach Upfront Ongoing/Year 1-Year TCO Notes
Jetson AGX Orin (1 robot) $500–$800 $0 (owned) $800 Carrier board adds $200–400
RTX 4090 workstation (5 robots) $3,000 $0 (owned) $3,000 $600/robot amortized over 1 year
Cloud GPU (A100, on-demand) $0 $2,200–$4,400 $2,200–$4,400 $0.25–$0.50/hr × 8,760 hr (24/7)
Cloud GPU (reserved instance) $0 $800–$1,600 $800–$1,600 ~50% discount for 1-year reservation
Jetson + cloud hybrid $500–$800 $400–$800 $900–$1,600 Edge for real-time, cloud for training

El hardware de borde gana decisivamente para la operación 24/7. La nube gana para los ciclos de desarrollo y ajuste fino donde la utilización de GPU es <40% (precio a pedido). Un enfoque híbrido ventaja para la inferencia de producción, la nube para la re-entrenamiento periódico proporciona lo mejor de ambos.

El RCSV plataforma proporciona un punto final de inferencia en la nube para el desarrollo y la evaluación, con un embalaje de despliegue de borde (TensorRT, Jetson) para la producción.

Inferencia de borde y nube para las políticas de robots

RCSV ofrece capacitación en políticas, paquetes de implementación de borde (TensorRT / Jetson) y puntos finales de inferencia en la nube para el desarrollo.

Explora la plataforma →