Volver a Guides

Modelos de VLA comparados (2026): OpenVLA, π0, SmolVLA, Octo & RT-2

Comparar los modelos de VLA por acceso a los puntos de control, representación de la acción, computación, compatibilidad de datos y protocolo de evaluación.

Utilice esta guía para seleccionar un modelo de Acción-Lenguaje-Visión por acceso a los puntos de control, representación de la acción, cálculo de inferencias, compatibilidad de los datos robóticos y el protocolo de evaluación que produjo cada resultado reportado.

Actualizado el 26 de julio de 2026 · Equipo de Investigación del RCSV

Respuesta directa

¿Qué modelo de VLA debería elegir un equipo robótico?

No hay mejor VLA universal. Elige primero si puedes acceder y ajustar el punto de control, luego por representación de acción, presupuesto de latencia, formato de datos robóticos compatibles y rendimiento en tu propia evaluación de nivel de tarea.

Estándar de evidencia: la arquitectura y los datos de acceso se comprueban con documentos o repositorios oficiales. Las puntuaciones publicadas de diferentes conjuntos de datos, encarnaciones de robots, hardware y protocolos no se consideran directamente comparables. Las estimaciones y las mediciones no disponibles se etiquetan.

  • [OpenVLA vs Octo]
  • [Brasar modelos de VLA]
  • [Encuentra conjuntos de datos compatibles]
  • [Revisar los protocolos de referencia]

¿Qué es un modelo VLA?

Un modelo de lenguaje de visión-acción (VLA) es una red neuronal que mapea las observaciones visuales y las instrucciones de lenguaje a las acciones de un robot. La columna vertebral del lenguaje de visión proporciona comprensión semántica ("recoger la taza roja"), mientras que la cabeza de acción traduce esa comprensión en movimientos físicos (una secuencia de ángulos articulares o posiciones de efector final).

Arquitectura de la ciudad

Todos los modelos VLA comparten tres componentes, aunque sus implementaciones difieren significativamente:

  • Codificador de visión: Convierte imágenes de la cámara en vectores de características. Las opciones comunes son los Transformadores de visión (ViT) o SigLIP. El codificador de visión se prepara previamente en conjuntos de datos de imágenes a escala de Internet (ImageNet, LAION) y se congela o se ajusta ligeramente durante el entrenamiento VLA.
  • Language backbone: Procesan instrucciones de texto e integranlas con características visuales. La mayoría de los VLAs utilizan un modelo de lenguaje grande (LLaMA, Gemma, PaLI) pre-entrenado como la columna vertebral, aprovechando sus capacidades de razonamiento y seguimiento de instrucciones.
  • Head de acción: Genera acciones de robots a partir de la representación de lenguaje de visión fusionado.

Representativa de la acción: el diferenciador clave

La forma en que un VLA representa y genera acciones determina sus características de rendimiento:

  • ** Tokens discretos (RT-2, OpenVLA):** Las acciones se cuantizan en tokens discretos y se generan autoregresivamente, como los tokens de texto.
  • Predicción fragmentada (SmolVLA): El modelo predice una secuencia de acciones futuras a la vez (normalmente 1050 pasos), inspirado en ACT. Produce trayectorias más suaves y es más eficiente en la computación en el tiempo de inferencia.
  • Combinación de flujo (π0): Las acciones se generan mediante la denotación iteracional de una muestra aleatoria en una trayectoria de acción válida. Produce las acciones más suaves y maneja mejor las distribuciones multimodal (tareas con múltiples soluciones válidas), pero requiere múltiples pasos de denotación en el momento de la inferencia.
  • Difusión (Octo): Similar al flujo de coincidencia pero utiliza un proceso de difusión al estilo DDPM. Bueno para acciones multimodal pero más lento en la inferencia que la predicción en pedazos.

Tabla de comparación de modelos de VLA

Model Creator Open Source Parameters Action Type Hardware Compatibility
RT-2 Google DeepMind No 55B Discrete tokens Google RT-X robots
OpenVLA Stanford / Berkeley Yes (Apache 2.0) 7.5B Discrete tokens Any
π0 Physical Intelligence No ~3B (est.) Flow matching Any
SmolVLA HuggingFace Yes (Apache 2.0) 450M Chunked (ACT-style) Any
Octo UC Berkeley Yes (MIT) ~93M Diffusion Any
RoboFlamingo Shanghai AI Lab Yes ~9B Autoregressive Any
Helix Figure AI No Undisclosed Undisclosed Figure 02

Inmersión profunda: cada modelo de VLA

RT-2 (Google DeepMind)

Arquitectura: RT-2 se construye sobre PaLI-X (55B parámetros) o PaLM-E (12B parámetros). El codificador de visión es un ViT-e (4B parámetros), y el modelo de lenguaje procesa tanto los tokens visuales como los tokens de texto. Las acciones se representan como cadenas de texto de posiciones conjuntas discretas (por ejemplo, "1 128 91 241 5 101 127") y generadas autoregresivamente por el modelo de lenguaje.

** Datos de capacitación:** Formación en el conjunto de datos RT-X de Google que contiene aproximadamente 130.000 demostraciones de 13 tipos de robots. Además aprovecha el pre-entrenamiento en lenguaje de visión a escala de Internet desde la columna vertebral de PaLI-X.

** Performance:** RT-2 demostró capacidades emergentes siguiendo instrucciones que involucran conceptos nunca vistos durante el entrenamiento de robots (por ejemplo, "mover el objeto al álbum de Taylor Swift"). En los puntos de referencia estándar, logró un éxito del 62% en nuevos conceptos semánticos, en comparación con el 32% para RT-1.

Requisitos de ajuste: No está disponible públicamente. Google no ha publicado pesas ni código de entrenamiento.

Pros: La generalización semántica emergente más fuerte; primera prueba de que el concepto de VLA funciona a escala.

Cons: Fuente cerrada; requiere un cálculo masivo; los parámetros 55B hacen difícil la inferencia en tiempo real; las acciones discretas de un solo paso producen movimientos tirantes.

OpenVLA (Stanford / Berkeley)

Arquitectura: Construido sobre la columna vertebral de Prismatic VLM (encodadores de visión Llama-2 7B + SigLIP + DinoV2). Las acciones se discretionan en 256 contenedores por dimensión y se predicen autoregresivamente como tokens. El codificador de visión dual (SigLIP para características semánticas + DinoV2 para características espaciales) da a OpenVLA una base visual más fuerte que los diseños de codificador único.

** Datos de formación:** Formación en el conjunto de datos Open X-Embodiment (~ 970K trayectorias de 22 realizaciones de robots).

** Performance:** En el índice LIBERO, el OpenVLA mejorado logra un 8595% de éxito dependiendo de la dificultad de la tarea. En las evaluaciones de robots reales con los brazos WidowX y Franka, coincide o supera las políticas de ACT específicas de la tarea en las tareas vistas y las supera significativamente en las variaciones de tareas no vistas.

** Requisitos de ajuste fino:** 2x A100 (80 GB) para ajuste fino completo; 1x A100 para ajuste fino LoRA. Tiempo de entrenamiento: 824 horas para 200 demostraciones. LoRA reduce la memoria a ~ 40 GB a un pequeño costo de rendimiento.

Pros: Fuente abierta con excelente documentación; base de código abierto más fuerte; comunidad grande y desarrollo activo; trabaja en cualquier robot con un simple mapeo de espacio de acción.

Cons: Parámetros de 7,5B significan ~300 ms por paso de acción en las GPU de consumo (demasiado lento para tareas reactivas); tokens discretos producen acciones menos suaves que la coincidencia de flujo o predicción en pedazos; requiere una gran cantidad de VRAM para ajuste fino.

π0 (Inteligencia física)

Arquitectura: π0 utiliza una columna vertebral de lenguaje de visión (probablemente basada en PaLI, detalles no completamente revelados) con una cabeza de acción de coincidencia de flujo.

** Datos de formación:** Formados en un conjunto de datos propietario de miles de horas de datos de teleoperación en múltiples plataformas de robots (Franka, UR5, manipuladores móviles, manos destrezas).

** Performance:** π0 demostró la generalización de tareas más amplia de cualquier política de robots, realizando tareas de pliegue de ropa, bus de mesa, empaquetado de cajas y montaje en diferentes ejemplos de robots de un solo modelo.

** Requisitos de ajuste:** No está disponible públicamente.

Pros: Generación de acción más suave; generalización de tareas más amplia demostrada; maneja mejor la manipulación rica en contactos que las VLA basadas en tokens; soporte multi-embodamiento.

Cons: Fuente cerrada; no hay pesos públicos; la inferencia requiere múltiples pasos de denotación (1020), añadiendo latencia; acceso comercial sólo a través de la asociación de Inteligencia Física.

SmolVLA (HuggingFace)

Arquitectura: SmolVLA utiliza SmolVLM (un modelo compacto de lenguaje de visión basado en Idefics-3) como su columna vertebral con una cabeza de predicción de acción en pedazos. La cabeza de acción predice una secuencia de acciones futuras (pieza de acción) en un solo paso hacia adelante, inspirada en la predicción en pedazos de ACT. El codificador de visión es un modelo SigLIP-400M, y la columna vertebral de lenguaje es un transformador de parámetros de 500M.

** Datos de formación:** Formación en un subconjunto seleccionado de Open X-Embodiment más conjuntos de datos de la comunidad LeRobot.

** Performance:** En el índice LIBERO, SmolVLA logra un éxito de 8290% dentro del 5% de OpenVLA a pesar de tener 16 veces menos parámetros. En las evaluaciones de robots reales, el SmolVLA ajustado coincide con OpenVLA en tareas simples y tiene un rendimiento ligeramente inferior en tareas complejas de múltiples pasos. La ventaja clave es la velocidad de inferencia: SmolVLA funciona a 1530 Hz en una sola RTX 4090, lo suficientemente rápido como para la manipulación reactiva.

Requisitos de ajuste fino: 1x RTX 4090 (24 GB) para ajuste fino completo; tiempo de entrenamiento 412 horas para 200 demostraciones.

Pros: VLA de código abierto más pequeño y rápido; se ejecuta en hardware de consumo; predicción fragmentada produce acciones fluidas; código de capacitación completo disponible en HuggingFace; comunidad activa.

Cons: La comprensión del lenguaje está limitada por una columna vertebral más pequeña en comparación con los modelos 7B+; es menos robusta para nuevas instrucciones; la predicción fragmentada puede tener dificultades con tareas de horizonte muy largo.

Octo (UC Berkeley)

Arquitectura: Octo utiliza una columna vertebral de transformador con una cabeza de acción de difusión. A diferencia de los modelos VLA anteriores, Octo no utiliza una columna vertebral de modelo de lenguaje pre-entrenada. En su lugar, utiliza un transformador más pequeño entrenado desde cero en datos robóticos, con el acondicionamiento de lenguaje opcional. La cabeza de difusión genera trayectorias de acción a través de denociación iterativa.

** Datos de formación:** Formados en el conjunto de datos de los X-embodiment abiertos (~ 800K trayectorias).

** Performance:** En el índice de referencia SIMPLER, Octo-Base logra un éxito del 5075% en múltiples entornos simulados. Su fuerza es la velocidad de adaptación: la ajuste fino en 2050 demostraciones de una nueva tarea tarda de 30 minutos a 2 horas en una sola GPU.

Requisitos de ajuste fino: 1x RTX 3090 o mejor; tiempo de entrenamiento de 30 minutos a 2 horas.

Prós: Ajuste fino más rápido; menor requisito de cálculo; la cabeza de difusión maneja bien las acciones multimodal; diseñada para prototipos rápidos.

Cons: La comprensión de idiomas más débil (sin la columna vertebral del LLM); menor rendimiento absoluto que OpenVLA o SmolVLA en tareas complejas; la inferencia de difusión es más lenta que la predicción fragmentada.

RoboFlamingo (Laboratorio de IA de Shanghai)

Arquitectura: Construido en OpenFlamingo (un modelo multimodal basado en MPT-7B), RoboFlamingo agrega una cabeza de predicción de acción robot a un modelo de lenguaje de visión pre-entrenado. Utiliza módulos de repetición de perceptores para procesar eficientemente historias visuales de múltiples marcos, lo que permite al modelo razonar sobre la dinámica temporal.

** Datos de formación:** Formación en una combinación de datos de referencia de CALVIN y demostraciones personalizadas de robots reales.

** Performance:** En el índice de referencia CALVIN, RoboFlamingo obtiene resultados de última generación en tareas de horizonte largo de múltiples pasos. Su razonamiento visual temporal (procesamiento de secuencias de marcos en lugar de marcos individuales) le da una ventaja en tareas que requieren memoria de pasos anteriores.

Requisitos de ajuste fino: 2x A100 (80 GB) para ajuste completo debido a la columna vertebral del parámetro 9B.

Prós: Un buen rendimiento de tareas a largo plazo; razonamiento visual temporal; código abierto.

Cons: Gran tamaño del modelo (9B); evaluaciones de robots reales publicadas limitadas; comunidad más pequeña que OpenVLA o SmolVLA; generación de acciones autoregresivas produce acciones de un solo paso.

Cómo elegir: Marco de decisión de VLA

La elección del modelo VLA adecuado depende de tres factores: su presupuesto de cálculo, su disponibilidad de datos y sus requisitos de tarea.

Por presupuesto de cálculo

Budget Ajuste fino Hardware Recommended Model Inference Speed
Consumer ($0–$2K GPU) 1x RTX 4090 SmolVLA or Octo 15–30 Hz
Research lab ($5K–$20K) 1–2x A100 OpenVLA (LoRA) or SmolVLA 3–15 Hz
Well-funded lab ($20K+) 4+ A100 or H100 OpenVLA (full) or custom VLA 3–10 Hz
Enterprise Cloud cluster π0 (API) or custom training Varies

Por tipo de tarea

Task Key Requirement Best Model Why
Simple pick-and-place Speed, low compute SmolVLA or Octo Fast inference, minimal data needed
Language-conditioned manipulation Semantic understanding OpenVLA Strongest language backbone among open models
Contact-rich manipulation Smooth, precise actions π0 or SmolVLA Flow matching / chunked actions handle contact better
Multi-step long-horizon Temporal reasoning RoboFlamingo or OpenVLA Multi-frame processing, strong LLM backbone
Rapid prototyping Fast iteration Octo 30-min fine-tuning on 20 demos
Bimanual coordination Multi-arm action space SmolVLA or Octo Flexible action spaces, chunked prediction

Por disponibilidad de datos

  • 2050 demostraciones: Octo (diseñado para ajuste rápido y fino con datos mínimos)
  • 50200 demostraciones: SmolVLA (buen rendimiento con datos moderados) o ACT (linia de base no VLA, muy eficaz con datos limitados)
  • ** 200500 demostraciones:** OpenVLA (la ajuste fino completo obtiene los mejores resultados en esta escala)
  • 500+ demostraciones: Cualquier beneficio del modelo; considere el ajuste completo de OpenVLA o la formación de un modelo personalizado

Ajuste el VLA en los datos de tu robot

Requisitos para el formato de datos

Todos los principales modelos de VLA esperan datos de formación en uno de dos formatos:

  • RLDS (Reinforcement Learning Datasets): El estándar para los modelos de Open X-Embodiment. Usado por Octo, OpenVLA y RT-2. Cada episodio se almacena como una secuencia de (observación, acción, recompensa) tuples en formato TFRecord.
  • **Formatado de LeRobot:**El formato de HuggingFace para SmolVLA y el marco de entrenamiento de LeRobot. Cada episodio se almacena como un archivo de Parquet con columnas de imagen y acción sincronizadas, además de un archivo de metadatos JSON.

La línea de recogida de datos de RCSV emite ambos formatos. Consulte nuestra guía de formato de datos (T5) para obtener detalles de conversión.

Requisitos de la GPU y tiempo de formación

Model Method Min GPU VRAM Time (200 demos)
SmolVLA Full fine-tune 1x RTX 4090 24 GB 4–12 hours
OpenVLA LoRA 1x A100 40 GB 8–16 hours
OpenVLA Full fine-tune 2x A100 80 GB each 12–24 hours
Octo Full fine-tune 1x RTX 3090 24 GB 0.5–2 hours
RoboFlamingo Full fine-tune 2x A100 80 GB each 16–32 hours

LoRA vs. ajuste completo

La Adaptación de bajo rango (LoRA) congela los pesos pre-entrenados y entraña matrices de adaptadores pequeñas, reduciendo los requisitos de memoria en un 5070%.

  • Auroración de las tareas: Actualiza todos los parámetros de 7.5B. Requiere 2x A100 (80 GB).
  • ** LoRA ajuste fino:** Trena ~ 50M parámetros de adaptador (ranque 32). Requiere 1x A100 (40 GB). Rendimiento dentro del 25% de ajuste fino completo para la mayoría de las tareas. Recomendado como el enfoque predeterminado a menos que tenga exceso de computación.

Ejemplo: Arreglo de SmolVLA con LeRobot

# Install LeRobot
# pip install lerobot

from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
from lerobot.common.policies.smolvla.configuration_smolvla import SmolVLAConfig
from lerobot.common.policies.smolvla.modeling_smolvla import SmolVLAPolicy

# Load your dataset (collected at RCSV or locally)
dataset = LeRobotDataset("your_org/your_dataset")

# Configure the policy
config = SmolVLAConfig(
    input_shapes={
        "observation.images.top": [3, 480, 640],
        "observation.images.wrist": [3, 480, 640],
        "observation.state": [7],  # 6 joints + gripper
    },
    output_shapes={
        "action": [7],
    },
    action_chunk_size=50,
)

# Initialize from pre-trained weights
policy = SmolVLAPolicy(config, dataset_stats=dataset.stats)
policy.load_pretrained("HuggingFaceTB/SmolVLA-base")

# Fine-tune (see LeRobot docs for full training loop)
# python lerobot/scripts/train.py \
#     --policy.type=smolvla \
#     --dataset.repo_id=your_org/your_dataset \
#     --training.num_epochs=100

Recopilación de datos del RCSV para el oleoducto de ajuste fino

El flujo de trabajo típico para los equipos que utilizan los servicios de recogida de datos de RCSV:

  1. Capa de la tarea: Definir las tareas de manipulación, las variaciones de objetos, los criterios de éxito.
  2. Demonstrantes de colección: Los operadores de RCSV recogen demostraciones de expertos en OpenArm 1 o DK1 con grabación sincronizada de múltiples cámaras. Campaña piloto: 100 demostraciones ($2,500). Campaña completa: 500 demostraciones ($8,000).
  3. Recibir datos formateados: Los datos se entregan tanto en HDF5 (compatible con la política de difusión ACT) como en formato LeRobot (compatible con SmolVLA/OpenVLA).
  4. Afinar tu VLA: Utiliza el conjunto de datos entregado para ajustar SmolVLA (GPU de consumo) o OpenVLA (A100). RCSV puede proporcionar acceso computacional o orientación sobre la configuración de GPU en la nube.
  5. Evalúa e iterar: Implemente la política de ajuste a la perfección en su robot. Si las tasas de éxito están por debajo del objetivo, recoge demostraciones específicas adicionales para los casos de fallas.

Benchmarks del mundo real: precisión vs velocidad de inferencia

Nota de metodología

No lea esta tabla como una tabla de clasificación normalizada

Los valores a continuación son reportados o resultados indicativos recogidos de diferentes versiones de modelos y entornos. Son útiles para formar una lista corta, pero no establecen un ganador porque las definiciones de tareas, los puntos de control, los espacios de observación, los espacios de acción, el hardware y los criterios de éxito difieren.

Una comparación de grado de decisión requiere la misma versión del conjunto de datos, realización, conjunto de tareas, política de semillas, hardware de inferencia, rúbrica de éxito y protocolo de ejecución repetida para cada candidato.

Model LIBERO-Long (5 tasks) SIMPLER (avg) Inference (RTX 4090) Inference (A100)
RT-2 (55B) N/A (closed) N/A (closed) N/A ~1 Hz
OpenVLA (7.5B) 90% 72% ~3 Hz ~8 Hz
π0 N/A (closed) N/A (closed) N/A ~5 Hz (est.)
SmolVLA (450M) 86% 68% ~20 Hz ~30 Hz
Octo (93M) 72% 58% ~10 Hz ~25 Hz
RoboFlamingo (9B) 82% (CALVIN) N/A ~2 Hz ~6 Hz

La diferencia de velocidad de inferencia: Para las tareas reactivas (captura de objetos, montaje dinámico), se necesita un control ≥10 Hz. Esto limita las opciones prácticas a SmolVLA y Octo en el hardware del consumidor. Para las tareas de manipulación más lentas (pick-and-place, embalaje), 35 Hz es suficiente, lo que hace viable OpenVLA. Para las tareas ricas en contactos que requieren precisión sobre velocidad (inserción, montaje), la inferencia más lenta es aceptable si la calidad de la acción es alta.

** Nota importante:** Los números de referencia se miden en conjuntos de datos específicos y protocolos de evaluación. El rendimiento en el mundo real depende de su tarea específica, entorno y robot. Un modelo que alcance el 90% en LIBERO puede alcanzar el 60% en su tarea si el entorno visual o el conjunto de objetos difiere significativamente. Siempre evalúe en su configuración objetivo.

Lectura relacionada

Relacionado: IA física en 2026 · Acción Chunking Transformers · Servicios de datos · Guía marco de LeRobot · Teleoperación del ratón espacial · Catálogo de hardware · Glosario de robótica