Comparación de modelos de VLA 2026: Octo, OpenVLA, Pi0, GR00T, SmolVLA y OpenPI
Compare modelos de lenguaje de visión-acción (VLA) para el aprendizaje de robots: Octo, OpenVLA, Pi0, GR00T, SmolVLA. Arquitectura, datos de entrenamiento, velocidad de inferencia, compatibilidad de hardware y rendimiento de robots reales.
Los modelos de visión-lenguaje-acción (VLA) son la arquitectura dominante para el aprendizaje generalista de robots en 2026. Esta página compara todos los principales modelos de VLA
Actualizado el 16 de abril de 2026 · Equipo de Investigación del RCSV · 12 min lectura
¿Qué son los modelos VLA?
Un modelo de visión-lenguaje-acción (VLA) es una red neuronal de extremo a extremo que toma ** imágenes de cámara** (visión) y ** instrucción de tareas de lenguaje natural** (lenguaje) como entradas y salidas ** comandos de motor de robot** (acción)
La idea clave detrás de los VLA es la unificación arquitectónica. Antes de los VLA, los sistemas de aprendizaje de robots eran tuberías modulares: un modelo de visión separado detectaba objetos, un planificador separado generaba una estrategia y un controlador separado producía comandos motores. Cada módulo fue entrenado de forma independiente y los errores se cascadas entre módulos. Los VLA reemplazan esta tubería con un solo modelo entrenado de extremo a extremo en demostraciones, eliminando la ingeniería de interfaz y la propagación de errores.
El componente "lenguaje" es lo que hace que los VLA sean cualitativamente diferentes de los enfoques de aprendizaje de robots anteriores como [ACT]
Comparación de arquitectura
| Model | Vision Codificador | LLM Backbone | Action Head | Espacio de Acciones | Context Length |
|---|---|---|---|---|---|
| Octo | Custom ViT | Transformer (93M total) | Diffusion | Continuous (EEF delta) | 2 frames |
| OpenVLA | SigLIP (400M) | LLaMA 2 (7B) | Discrete tokenization | 256 bins per dim | 2048 tokens |
| Pi0 | PaLI-based (est.) | Custom (~3B total) | Flow Matching | Continuous (joint + EEF) | Not disclosed |
| GR00T N1 | Eagle (NVIDIA) | Custom (~2B total) | Dual (diffusion + MLP) | Continuous (whole-body) | Not disclosed |
| SmolVLA | SigLIP (400M) | SmolLM2 (135M) | Diffusion | Continuous (joint pos) | 1024 tokens |
| OpenPI | SigLIP (400M) | LLaMA-based (~3B) | Flow Matching | Continuous (joint + EEF) | 2048 tokens |
Modelo de buceo profundo
Octo (UC Berkeley)
Octo es el caballo de trabajo de la comunidad de VLA de código abierto. Construido en el Berkeley Robot Learning Lab (Ghosh et al., 2024), Octo fue diseñado con una clara filosofía de ingeniería: ser lo suficientemente pequeño como para ajustar en una sola GPU, lo suficientemente rápido como para el control en tiempo real y lo suficientemente general como para trabajar en todas las realizaciones.
Arquitectura: Un transformador compacto que procesa las observaciones de imágenes tokenizadas y las instrucciones de lenguaje a través de capas de atención compartidas, luego genera acciones a través de una cabeza de difusión.
** Datos de entrenamiento:** 800K episodios del conjunto de datos Open X-Embodiment, pesadamente ponderados hacia el conjunto de datos Bridge V2 (robot WidowX) y RT-1 (Robots Everyday de Google). Esto significa que Octo funciona mejor fuera de la caja en la manipulación de mesa con brazos de clase WidowX.
Atulado fino: Octo se sintoniza en 20-30 minutos en un solo A100 con 50-100 demostraciones. Este giro rápido lo hace ideal para una iteración rápida: recoger 50 demos por la mañana, sintonizarlo durante el almuerzo, evaluar por la tarde. En RCSV, usamos Octo como base predeterminada para proyectos piloto de recopilación de datos porque proporciona la retroalimentación más rápida sobre la calidad de los datos.
Limitations: El presupuesto del parámetro 93M limita la comprensión del lenguaje y el razonamiento visual. Octo lucha con tareas que requieren razonamiento espacial ("poner la copa a la izquierda de la placa") o nuevas categorías de objetos no bien representadas en Bridge V2. Para estas tareas, la columna vertebral de LLM más grande de OpenVLA funciona significativamente mejor.
** Mejor para:** Equipos que necesitan una política de robótica de trabajo rápida, tienen computación limitada o están iterando en la calidad de la recopilación de datos antes de comprometerse con un modelo más grande.
OpenVLA (Stanford / Berkeley)
OpenVLA (Kim et al., 2024) es el VLA de código abierto más capaz, basado en la idea de que una columna vertebral de LLM de parámetro 7B proporciona suficiente capacidad para una generalización de tareas genuina condicionada por el lenguaje. Fue el primer modelo abierto en demostrar la transferencia de tiro cero a nuevas descripciones de tareas en objetos no vistos.
Arquitectura: El codificador de visión SigLIP (400M params) alimenta los tokens visuales en un LLaMA 2 (7B params) afinado. Las acciones se tokenizan en 256 contenedores discretos por dimensión y se predicen como los próximos tokens
** Datos de capacitación:** 970K episodios del conjunto de datos Open X-Embodiment (22 realizaciones de robots). La cobertura más amplia de la realización en comparación con Octo da a OpenVLA una mejor generalización entre robots.
Auroración fina: Requiere 8xA100 (o equivalente) para un ajuste fino eficiente debido al tamaño del parámetro 7B. El ajuste fino de LoRA reduce esto a 1-2 A100 a un costo de un rendimiento ligeramente menor. 100-200 demostraciones recomendadas para una nueva tarea.
Inferencia: ~5 Hz en A100, ~2 Hz en Jetson AGX Orin. Requiere un desglose de acción (predecir 10-20 pasos, ejecutar a 50 Hz) para el despliegue en tiempo real. La latencia de 200-500 ms por inferencia significa que el robot opera en planos de 0.2-0.4 segundos
** Mejor para:** Sistemas multicomisión en lenguaje donde se desea un modelo único para manejar diversas instrucciones de tareas.
Pi0 (inteligencia física)
Pi0 es la tecnología de última generación de la Inteligencia Física, la compañía fundada por Sergey Levine, Chelsea Finn y otros ex alumnos de Berkeley / Stanford.
Mejoramiento de flujo vs difusión: Ambos son modelos generativos que producen trayectorias de acción, pero el movimiento de flujo utiliza vías de interpolación en línea recta (transporte óptimo) en lugar de las vías curvas de ruido a señal de difusión.
** Performance:** Las demostraciones de Pi0 muestran una generalización entre las tareas que ningún modelo de código abierto ha coincidido: un solo punto de control para plegar la ropa, las mesas de limpieza, las cajas de empaquetado y el funcionamiento de los electrodomésticos de cocina.
Acceso: Pi0 no está disponible públicamente. Physical Intelligence ofrece acceso a API a socios seleccionados. La reimplementación comunitaria OpenPI (ver más adelante) proporciona una aproximación utilizando los detalles de arquitectura publicados.
** Mejor para:** Equipos con acuerdos de asociación PI que necesitan un rendimiento de última generación y están dispuestos a aceptar el bloqueo de proveedores.
GR00T N1 (NVIDIA)
GR00T N1 es el modelo de fundación centrado en humanoides de NVIDIA, diseñado para el ecosistema Isaac Lab y optimizado para el despliegue de Edge Jetson Thor.
Arquitectura de doble sistema: GR00T N1 utiliza dos modelos interconectados: una espina dorsal VLA "lenta" (2-5 Hz) que interpreta escenas visuales e instrucciones de lenguaje para producir planes de acción de alto nivel, y una política "rápida" (200+ Hz) que convierte los planes en comandos motores con retroalimentación reactiva. Esto refleja la distinción biológica entre la planificación deliberada y el control motor reflexivo.
Premiera formación en sim: Pre-entrenado en episodios de 1M+ en Isaac Lab (simulación física con aleatorización de dominio), luego afinado con episodios humanoides reales de 50K-100K. Este enfoque sim-first funciona bien para la locomoción y el equilibrio de todo el cuerpo, pero aún requiere datos reales significativos para las tareas de manipulación.
** Ecosistema de hardware:** Optimizado para NVIDIA Jetson Thor (la plataforma de computación específica para humanoides). También se ejecuta en Jetson AGX Orin con un rendimiento reducido. GR00T SDK proporciona interfaces estandarizadas para Figure, Agility Robotics, Apptronik y 1X humanoides.
** Mejor para:** Proyectos de robots humanoides, especialmente aquellos que ya están en el ecosistema NVIDIA. No son adecuados para los brazos de manipulación de mesa.
SmolVLA (cara abrazada)
SmolVLA es la apuesta de Hugging Face de que los modelos de VLA pueden ser hechos lo suficientemente pequeños para el hardware del consumidor sin sacrificar la generalización útil.
Arquitectura: Codificador de visión SigLIP (400M) emparejado con SmolLM2 (135M modelo de lenguaje de parámetros) y una cabeza de acción de difusión.
** Integración de LeRobot:** SmolVLA es un ciudadano de primera clase en el marco [LeRobot]
** Performance:** En los puntos de referencia estándar (SIMPLER, Bridge V2 eval), SmolVLA alcanza el 60-75% de la tasa de éxito de OpenVLA en 1/14 de la cuenta de parámetros. Para el ajuste fino de tarea única, la brecha se reduce al 5-10% con demostraciones suficientes (200+).
** Mejor para:** Usuarios de LeRobot, aficionados con GPUs de consumo, educación y equipos que necesitan ejecutar inferencias en Jetson Orin NX ($499) en lugar de Jetson AGX Orin ($1,999).
OpenPI (Comunidad)
OpenPI es una reimplementación comunitaria de la arquitectura Pi0 de la Inteligencia Física, basada en el papel publicado y opciones de diseño de ingeniería inversa. Proporciona la cabeza de acción de coincidencia de flujo que distingue a Pi0 de otros VLA, en un paquete de código abierto.
Arquitectura: Código de visión SigLIP con una columna vertebral basada en LLaMA (~ 3B parámetros totales) y cabeza de acción de coincidencia de flujo.
** Formación:** Formación comunitaria en una combinación de conjuntos de datos de Open X-Embodiment, DROID y de contribución comunitaria.
** Performance:** Obtiene aproximadamente el 70-80% del rendimiento informado de Pi0 en benchmarks comparables. La cabeza de coincidencia de flujo proporciona trayectorias de acción notablemente más suaves que las alternativas basadas en la difusión (Octo, SmolVLA), que algunos usuarios prefieren para tareas ricas en contactos.
** Mejor para:** Los investigadores interesados en arquitecturas de compatibilidad de flujo que desean acceso de código abierto y la capacidad de inspeccionar y modificar el modelo completo.
Compatibilidad con el hardware
| Model | WidowX / ALOHA | OpenArm 1 | Franka | Unitree G1 | Koch / SO-100 |
|---|---|---|---|---|---|
| Octo | Native | Fine-tune | Native | Fine-tune | Fine-tune |
| OpenVLA | Native | Fine-tune | Native | Fine-tune | Fine-tune |
| Pi0 | Supported | Via PI API | Supported | Via PI API | Not supported |
| GR00T N1 | Not targeted | Not targeted | Not targeted | Native | Not targeted |
| SmolVLA | Native | Native (LeRobot) | Fine-tune | Fine-tune | Native (LeRobot) |
| OpenPI | Community | Fine-tune | Community | Fine-tune | Community |
"Native" = pre-entrenado en datos de esta realización; funciona con cero disparos o con ajuste mínimo. "Fine-tune" = requiere 50-200 demostraciones en este robot específico. "Comunidad" = integración mantenida por la comunidad; puede requerir configuración manual.
Entrenando a tu propio VLA
La mayoría de los equipos deberían finar un VLA existente en lugar de entrenar desde cero.
Ajuste fino (recomendado para la mayoría de los equipos)
- Elige tu modelo base: Octo para la velocidad, OpenVLA para la capacidad, SmolVLA para la integración de LeRobot
- Recoge 50-200 demostraciones de tu tarea objetivo en tu plataforma robótica específica (ver [guía de recogida de datos]
- ** Datos de formato:** Convertir al formato esperado del modelo (formato del conjunto de datos LeRobot para SmolVLA/Octo, RLDS para OpenVLA)
- Tune fino: Octo: 30 minutos en 1 GPU. SmolVLA: 1-2 horas en 1 GPU. OpenVLA: 4-8 horas en 8 GPU (o 1-2 GPU con LoRA)
- Evaluación: Ejecutar 50 episodios de evaluación, medir la tasa de éxito, analizar los modos de fracaso
Formación desde cero (para arquitecturas especializadas)
El entrenamiento desde cero requiere más de 100K de demostraciones y un cálculo significativo (64-256 GPU-hora para la escala Octo, 1.000+ GPU-hora para la escala OpenVLA). Esto es apropiado sólo si usted tiene una arquitectura nueva, datos de gran escala propietarios o requisitos que los modelos existentes no pueden cumplir.
Indicadores de velocidad de inferencia
| Model | A100 (80GB) | Jetson AGX Orin | Jetson Orin NX | RTX 4090 | Action Chunking Needed? |
|---|---|---|---|---|---|
| Octo | 40+ Hz | 15-20 Hz | 8-12 Hz | 30+ Hz | No (built-in) |
| OpenVLA | 5-8 Hz | 1.5-3 Hz | OOM | 4-6 Hz | Yes (10-20 steps) |
| Pi0 | 10-15 Hz | 5-8 Hz | Not tested | 8-12 Hz | Optional |
| SmolVLA | 25+ Hz | 10-15 Hz | 5-8 Hz | 20+ Hz | No (built-in) |
| OpenPI | 8-12 Hz | 3-5 Hz | OOM | 6-10 Hz | Optional |
_Bendmarks medidos con precisión FP16, tamaño de lote 1, entrada de cámara única.
Cuándo usar qué VLA
Utilice este árbol de decisión para elegir su modelo:
- Necesitas resultados esta semana con un mínimo de cálculo? → Octo.
- Necesita multitarea con lenguaje condicionado con una fuerte generalización? → OpenVLA. Mejor base de lenguaje de código abierto.
- ** Trabajar con LeRobot y desear apoyo de ecosistemas nativos?** → SmolVLA.
- Construir una aplicación de robot humanoide? → GR00T N1.
- ¿Quiere las trayectorias de acción más suaves (tareas ricas en contactos)? → OpenPI.
- Necesita un máximo de rendimiento y tiene una asociación PI? → Pi0. Estado de la técnica, pero propietario.
- ** ¿Tiene una tarea única muy específica y no necesita un condicionamiento del lenguaje?** → Considere ACT o Política de difusión en lugar de un VLA. Son más simples, más rápidas de entrenar y a menudo logran mayores tasas de éxito en tareas individuales.
Recopilar datos de formación compatibles con el VLA
Los datos de formación de VLA tienen requisitos específicos que difieren de los datos para políticas más simples:
Requisitos de la cámara
- Resolución: Mínimo 640x480, recomendado 1280x720. Los codificadores de visión VLA descenden la muestra a 224x224 o 336x336 internamente, pero una mayor resolución de la fuente conserva los detalles durante la descenda de la muestra.
- Rata de fotogramas: 30 fps para fotogramas de cámara, sincronizados con grabación de estado conjunto de 50 Hz. La falta de coincidencia se maneja por el cargador de datos (interpolación de vecino más cercano).
- Vistas: Minimo 1 cámara de muñeca + 1 cámara externa. La mayoría de los VLA aceptan 2-4 vistas. Vistas adicionales mejoran el rendimiento pero aumentan el almacenamiento y el costo de inferencia.
- ** Calibración:** Las características intrínsecas y extrínsecas de la cámara deben registrarse, pero no son requeridas por la mayoría de las arquitecturas VLA (aprenden las características visuales directamente a partir de los píxeles).
Forma de acción
- Posiciones conjuntas: Registrar posiciones conjuntas absolutas a 50 Hz. Este es el formato más universal
que todos los VLA pueden consumir. - Posición del efecto final: También registra la posición EEF + orientación del cuaternion si está disponible. Algunos modelos (Octo, Pi0) pueden utilizar acciones del espacio EEF directamente.
- Estado del agarre: Posición binaria (abierta/cerrada) o continua del agarre.
Anotadas en el idioma
- Cada episodio necesita una descripción de tarea en lenguaje natural: "toma la taza roja y colocala en el platillo"
- Utilice un lenguaje específico y descriptivo. "Haz la tarea" es inútil; "Recoge el objeto más izquierdo" es útil
- Diversificamos el lenguaje en los episodios para la misma tarea para mejorar la generalización del lenguaje: "agarrar la taza", "recoger la taza de café", "tomar la taza de la mesa"
Formatos de salida
- HDF5: Norma para ACT, política de difusión y consumo directo de Octo
- RLDS (TensorFlow Datasets): Requerido para el formato de datos de pre-entrenamiento OpenVLA
- Formatos de LeRobot: Parquet + archivos de video en Hugging Face Hub. nativo para SmolVLA
El servicio de recogida de datos de RCSV (en inglés) se ejecuta en los tres formatos por defecto.
Lectura relacionada
- [IA física en 2026: Modelos de fundación sumergirse profundamente]
- [Modelos de VLA explicados (introducido) ]
- [Explicación de la política del ACT]
- [Política de difusión para robots]
- [Guía marco de LeRobot]
- [Guía de Teléoperación del ratón espacial]
- [Servicios de datos del RCSV]
Recopilar datos de formación de VLA en el RCSV
HDF5, RLDS y LeRobot estándar de salida de más de 50 configuraciones de robots. Comience con un piloto de $ 2,500
[Explorar los Servicios de Datos] [
Cada VLA aquí puede ser ajustado a sus propias demostraciones.
Recoge demos → Hardware que lo ejecuta → Corre una política →







