Inferencia de robots en tiempo real: Edge vs. Arquitectura en la nube Tradeoffs
Cuando ejecutar la inferencia de políticas de robots en el borde vs. nube <unk> análisis de latencia, opciones de hardware, cuantización de modelos y comparación de costos.
[← Investigación]
La arquitectura de inferencia de su política de robots determina qué modelos puede ejecutar, a qué costo, con qué garantías de latencia.
Requisitos de latencia por tipo de tarea
Antes de elegir la arquitectura de inferencia, necesita un requisito preciso de latencia para su tarea. La latencia requerida se establece por la frecuencia de control del robot y la naturaleza de la manipulación:
- Movimiento en espacio libre (brazo que se mueve hacia un objetivo): 50
100 ms de latencia de inferencia es aceptable. El brazo se mueve a baja velocidad durante las fases de aproximación, y una consulta de política de 100 ms de estabilidad no causa errores de posicionamiento por encima de la tolerancia de tarea. - ** Manipulación rica en contactos (inserción, ensamblaje):** Se requiere una latencia de inferencia de 10
20 ms. En el momento del contacto, pequeños cambios de estado (0,5 1 mm error de posición) pueden causar la falla de la tarea, y la política debe volver a solicitar con frecuencia para mantenerse en distribución. - Gestión reactiva (objeto en movimiento, transportador): < 50 ms requeridos. La posición del objeto cambia entre las consultas de política; las consultas obsoletas conducen a errores sistemáticos.
- Permisa crítica de seguridad: < 1 ms. Esto no puede depender en absoluto del ciclo de inferencia de la política
debe ser manejado por un controlador de seguridad dedicado en el robot.
Opciones de hardware de borde
El hardware de inferencia de borde se ejecuta en co-ubicación con el robot, eliminando la latencia de red de ida y vuelta.
| Hardware | TOPS (INT8) | Price | Power | Form Factor | Best For |
|---|---|---|---|---|---|
| NVIDIA Jetson AGX Orin 64GB | 275 TOPS | $499 (module) | 15–60W | Embedded module | Full policy inference at edge |
| NVIDIA Jetson Orin NX 16GB | 100 TOPS | $299 (module) | 10–25W | Embedded module | Smaller models, power-constrained |
| NVIDIA RTX 4090 (workstation) | ~1,600 TOPS (FP16) | $1,600 | 450W TDP | Desktop PCIe | Large model inference, multiple robots |
| Intel NUC with Arc GPU | ~40 TOPS | $600–$900 | 35W | Mini PC | Simple BC policies, low cost |
| Raspberry Pi 5 | ~5 TOPS | $80 | 5–10W | SBC | MLP policies only, very simple tasks |
Para la mayoría de las tareas de manipulación que ejecutan ACT o política de difusión, el NVIDIA Jetson AGX Orin es el hardware de borde de elección.
Tamaño del modelo vs. Latencia de inferencia
| Model | Parameters | Edge (Jetson AGX) | Cloud (A100) | Quantized INT8 Edge |
|---|---|---|---|---|
| BC (MLP policy) | ~1M | 1–3 ms | <1 ms | 1–2 ms |
| ACT (original) | ~84M | 50–100 ms | 15–30 ms | 20–50 ms (FP16) |
| Diffusion Policy (U-Net) | ~100M | 30–80 ms | 10–30 ms | 20–50 ms |
| Diffusion Policy (Transformer) | ~300M | 200–500 ms | 80–200 ms | 100–250 ms |
| OpenVLA (7B) | 7B | 3–10 s | 200–500 ms | 1–3 s (INT4) |
| Octo (93M) | 93M | 30–100 ms | 15–40 ms | 20–60 ms |
Estrategias de cuantificación
La cuantificación reduce la precisión del modelo para reducir la huella de memoria y aumentar la velocidad de inferencia, a un costo de la precisión:
- FP32 → FP16 (medio precisión): 2x reducción de memoria, <1
3% pérdida de precisión en la mayoría de los modelos de manipulación. Soportado nativo en todas las GPU de NVIDIA desde Pascal. Recomendado como predeterminado para la implementación de borde. - FP16 → INT8: Más 2 veces reducción de la memoria, 10
15% de pérdida de precisión típico de las políticas de manipulación. Acceptable para las tareas L1 L2; prueba cuidadosamente para las tareas de precisión L3+. Utilice NVIDIA TensorRT para la inferencia INT8 optimizada por Jetson. - FP16 → INT4 (4-bit): 4x reducción vs FP16. 15
25% pérdida de precisión. Es especialmente útil para modelos basados en LLM (OpenVLA) donde la columna vertebral del lenguaje representa la mayoría de los parámetros. - ** Optimización de TensorRT:** Más allá de la cuantización, TensorRT fusiona operaciones, optimiza el diseño de memoria y compila a núcleos CUDA optimizados para el hardware Jetson objetivo. A menudo proporciona 2
4x de velocidad adicional en la parte superior de la cuantización FP16 para modelos convolucionales.
Inferencia en la nube: cuando es aceptable
La inferencia en la nube es viable para casos de uso específicos en los que existe tolerancia a la latencia:
- ** Selección de políticas / planificación de tareas:** Un planificador de alto nivel que seleccione qué habilidades de bajo nivel ejecutar a continuación puede tolerar una latencia de 500 ms
2 s. Este es un punto de división natural: ejecutar la planificación basada en VLM en la nube, ejecutar habilidades de bajo nivel en el borde. - ** Entendimiento de la escena:** El análisis semántico de la escena (clasificación de objetos, estimación de la oferta) para la planificación pre-grap puede ejecutarse en la nube si el robot se detiene antes de iniciar la manipulación.
- Monitoreo de la teleoperación en tiempo no real: Un sistema de monitoreo basado en la nube que vigila el funcionamiento del robot y señala anomalías (sin tomar control directo) tolera cualquier latencia.
Comparación de costes: 1 año de TCO
| Approach | Upfront | Ongoing/Year | 1-Year TCO | Notes |
|---|---|---|---|---|
| Jetson AGX Orin (1 robot) | $500–$800 | $0 (owned) | $800 | Carrier board adds $200–400 |
| RTX 4090 workstation (5 robots) | $3,000 | $0 (owned) | $3,000 | $600/robot amortized over 1 year |
| Cloud GPU (A100, on-demand) | $0 | $2,200–$4,400 | $2,200–$4,400 | $0.25–$0.50/hr × 8,760 hr (24/7) |
| Cloud GPU (reserved instance) | $0 | $800–$1,600 | $800–$1,600 | ~50% discount for 1-year reservation |
| Jetson + cloud hybrid | $500–$800 | $400–$800 | $900–$1,600 | Edge for real-time, cloud for training |
El hardware de borde gana decisivamente para la operación 24/7. La nube gana para los ciclos de desarrollo y ajuste fino donde la utilización de GPU es <40% (precio a pedido). Un enfoque híbrido
El RCSV plataforma proporciona un punto final de inferencia en la nube para el desarrollo y la evaluación, con un embalaje de despliegue de borde (TensorRT, Jetson) para la producción.
Inferencia de borde y nube para las políticas de robots
RCSV ofrece capacitación en políticas, paquetes de implementación de borde (TensorRT / Jetson) y puntos finales de inferencia en la nube para el desarrollo.







