Modelos de VLA Comparados: RT-2, OpenVLA, Pi0, SmolVLA, RoboFlamingo (2025)
Completar la comparación 2025 de los modelos de visión-linguego-acción (VLA): RT-2, OpenVLA, Pi0, SmolVLA, RoboFlamingo. Parámetros, datos de entrenamiento, velocidad de inferencia, requisitos de hardware, estado de código abierto y cuándo ajustar a la formación desde cero.
[← Investigación]
Una comparación práctica de los modelos más importantes de visión-lenguaje-acción
VLA modela instrucciones de lenguaje en tierra en la percepción visual para producir acciones de robots
Acciones de LLM en lenguaje de visión
¿Qué es un modelo VLA?
Un modelo de visión-lenguaje-acción (VLA) es una red neuronal que toma observaciones visuales (imágenes de la cámara) y una instrucción de lenguaje natural como entrada, y produce predicciones de acción del robot como salida. La principal distinción de los modelos anteriores de aprendizaje robótico es el ** condicionamiento del lenguaje**: el mismo modelo puede seguir diferentes instrucciones sin reentrenamiento, lo que permite la generalización de tareas que las políticas de aprendizaje pura de imitación no pueden lograr.
La arquitectura VLA típica encierra tres componentes:
- Encodificador de visión: Procesan las observaciones de píxeles en bruto en una representación de características (generalmente un CLIP ViT o SigLIP)
- Modelio de lenguaje: Un LLM pre-entrenado (Llama, Gemma, PaLM, estilo Flamingo) que recibe tokens visuales junto con tokens de lenguaje y razona conjuntamente sobre ambos
- ** Cabeza de acción:** Un decodificador ligero que mapea los tokens de salida de LLM a predicciones de acción de robots
ya sea tokens de acción discretados (como RT-2) o vectores de acción continua (como OpenVLA, Pi0)
La premisa es que la pre-entrenamiento a escala de Internet en datos del lenguaje de visión da al LLM conocimiento del mundo basado en la columna vertebral que se transfiere a la manipulación de robots con mucho menos datos específicos de robots que la formación desde cero.
Los cinco modelos: lo que necesitas saber
RT-2 (Google DeepMind, 2023)
RT-2 (Robotic Transformer 2) es un VLA construido por Google DeepMind en la parte superior de PaLI-X (55B parámetros) y PaLM-E (562B parámetros). El resultado es un modelo que puede razonar sobre nuevas instrucciones en el momento de la inferencia
RT-2 demostró capacidades de razonamiento emergentes: cadena de pensamiento que impulsa un mejor rendimiento de tareas, y el modelo podría responder preguntas de hecho a mediados de ejecución. Sin embargo, es ** fuente cerrada**
OpenVLA (Stanford + UC Berkeley, 2024)
OpenVLA es el primer modelo de VLA de código abierto a gran escala. Está construido sobre Prismatic VLM (7B parámetros, basado en el codificador de visión Llama 2 + SigLIP) y sintonizado en demostraciones de robots 970k de Open X-Embodiment. OpenVLA discreteza las acciones en 256 canas por dimensión y las predice como tokens de lenguaje, siguiendo la formulación de RT-2.
La receta completa de entrenamiento, los pesos del modelo y el código de ajuste fino están disponibles públicamente en HuggingFace. El ajuste fino de OpenVLA en una nueva tarea normalmente requiere 50
Pi0 (Inteligencia física, 2024)
Pi0 es un VLA de la Inteligencia Física (pi.ai), la startup fundada por Sergey Levine, Chelsea Finn y otros de la comunidad robótica de Berkeley. Pi0 utiliza una cabeza de acción que coincide con el flujo en lugar de tokens de acción discretos. El modelo base se basa en PaliGemma (3B parámetros) con una cabeza de generación de acción inspirada en la difusión.
Pi0 es notable por demostrar una manipulación hábil en el mundo real a un nivel que no se ha demostrado previamente en VLAs de peso abierto: plegando la ropa, limpiando mesas desordenadas, montando objetos. Los pesos son ** parcialmente abiertos**
El objetivo de la investigación es mejorar la calidad de la vida de los trabajadores.
SmolVLA es la entrada de HuggingFace en el espacio VLA
SmolVLA ejecuta inferencias a ~30 Hz en un RTX 3090, por lo que es el primer VLA realmente práctico para el control de robots en tiempo real sin GPUs empresariales. Está entrenado en conjuntos de datos LeRobot e integra de forma nativa con la pila de entrenamiento LeRobot. El rendimiento se retrasa de OpenVLA en tareas complejas de vocabulario abierto, pero coincide o lo supera en dominios de tareas estrechos después de ajuste fino. Para los laboratorios con presupuestos limitados de GPU, SmolVLA es el punto de partida más accesible.
RoboFlamingo (Instituto de Tecnología de Beijing + Investigación de Microsoft, 2023)
RoboFlamingo sintoniza el modelo de lenguaje de visión OpenFlamingo (9B parámetros, basados en MPT-7B + CLIP ViT-L) para la manipulación de robots. A diferencia de RT-2 y OpenVLA, RoboFlamingo es ** solo para decodificadores**
RoboFlamingo es principalmente una contribución de investigación en lugar de un modelo listo para la producción. Su visión clave es que la capacidad de aprendizaje dentro del contexto de OpenFlamingo (alimentando algunos ejemplos de demostración directamente en la ventana de contexto) se transfiere a la manipulación de robots: se pueden proporcionar 1
Tabla de comparación de vista
| Model | Params | Base LLM | Training Data | Inference Hz | Open Source? | Fine-tune? |
|---|---|---|---|---|---|---|
| RT-2 | 55B / 562B | PaLI-X / PaLM-E | RT-1 dataset + web | 1–3 Hz | No (Google internal) | No |
| OpenVLA | 7B | Llama 2 + SigLIP | Open X-Embodiment (970k) | 6 Hz (A100) | Yes (weights + code) | Yes (LoRA / full) |
| Pi0 | ~3B | PaliGemma | pi.ai proprietary | 10–25 Hz | Weights (research) | Via pi.ai (commercial) |
| SmolVLA | 450M–2B | SmolLM2 + SigLIP | LeRobot datasets | 30 Hz (RTX 3090) | Yes (fully open) | Yes (LeRobot native) |
| RoboFlamingo | 9B | OpenFlamingo (MPT-7B) | Open X-Embodiment | 3–5 Hz (A100) | Yes (weights + code) | Yes (+ in-context) |
Requisitos de hardware para cada modelo
| Model | Min GPU (inference) | Recommended (inference) | Fine-tuning GPU | VRAM (inference) |
|---|---|---|---|---|
| RT-2 | N/A (not available) | TPU pod (Google) | N/A | N/A |
| OpenVLA | RTX 3090 (slow) | A100 40GB | A100 80GB (full) / RTX 4090 (LoRA) | ~16GB (BF16) |
| Pi0 | RTX 3090 | RTX 4090 / A100 | A100 40GB | ~8GB (BF16) |
| SmolVLA | RTX 3080 10GB | RTX 3090 | RTX 3090 / RTX 4090 | 2–6GB |
| RoboFlamingo | A100 40GB | A100 80GB | 2× A100 80GB | ~22GB (BF16) |
Las representaciones de la acción: una diferencia crítica
La forma en que cada modelo realiza acciones determina qué tareas puede realizar bien y qué tan rápido puede ejecutarse:
- ** Tokens de acción discreta (RT-2, OpenVLA, RoboFlamingo):** Las acciones se cuantifican en contenedores (normalmente 256 por dimensión) y se predicen como tokens de texto por el LLM. Permite aprovechar la máquina autoregresista completa del LLM y el aprendizaje dentro del contexto.
- Trabajo continuo con coincidencia de flujo (Pi0): Las acciones se predicen como vectores continuos a través de un proceso de coincidencia de flujo inspirado en la difusión. Permite trayectorias lisas y precisas y un control hábil. Frecuencia más alta que los modelos basados en tokens con un conteo de parámetros equivalente.
- ** Token híbrido + continuo (SmolVLA):** Tokens de lenguaje para el razonamiento; cabeza de salida continua para la acción. Equilibra la generalización del lenguaje con la precisión de control.
Cuándo ajustar bien el tren con el tren desde cero
Para prácticamente todos los equipos, la ajuste fino de un VLA pre-entrenado es el punto de partida correcto. Entrenar un VLA desde cero requiere millones de demostraciones de robots y recursos de computación masivos que solo Google, DeepMind e Inteligencia Física pueden combinar. La pregunta práctica es qué modelo pre-entrenado debe ajustar y cómo.
- A la perfección cuando:
- Las tareas de destino son similares en estilo a los datos de pre-entrenamiento (manipulación de la mesa, trabajo de selección y ubicación, tareas de cocina)
- Tiene 50
500 demostraciones de la tarea objetivo - Su morfología robótica está representada en Open X-Embodiment o en conjuntos de datos LeRobot
- Necesitas una generalización razonable de tiro cero dentro de una categoría de tareas
Entrenamiento desde cero (o utilizar la política de no VLA) cuando:
- Su dominio de tareas es radicalmente diferente de la pre-entrenamiento (manipulación submarina, robótica quirúrgica, montaje industrial)
- Su espacio de acción no es estándar (por ejemplo, hidráulica, cableado, > 7 manos DoF)
- Necesitas una velocidad de inferencia máxima y puedes permitirte limitar la generalidad de tareas
en este caso, ACT o la política de difusión entrenada desde cero superará un VLA ajustado en una tarea específica estrecha - Las restricciones de interpretación o seguridad hacen que las grandes columnas de la columna vertebral de la LLM sean problemáticas.
La mejor ajuste de OpenVLA: pasos prácticos
OpenVLA es el punto de partida más accesible para los laboratorios que desean ejecutar su propio ajuste fino.
# Install OpenVLA dependencies
pip install openvla
# Fine-tune with LoRA (requires single RTX 4090)
python experiments/robot/finetune.py \
--pretrained_checkpoint openvla/openvla-7b \
--data_root_dir /path/to/your/lerobot/dataset \
--dataset_name your_task_name \
--run_root_dir ./runs \
--use_lora True \
--lora_rank 32 \
--batch_size 16 \
--num_steps 10000 \
--learning_rate 2e-4
Tiempo de ajuste fino esperado con LoRA en RTX 4090: ~ 6 horas para 10k pasos con 100 demostraciones.
El ajuste de la SmolVLA: pasos prácticos
SmolVLA se integra directamente con LeRobot, lo que lo convierte en el camino más rápido a un VLA en funcionamiento en su robot:
python lerobot/scripts/train.py \
policy=smolvla \
env=aloha \
dataset_repo_id=your-username/your-dataset \
hydra.run.dir=outputs/train/smolvla_task \
training.batch_size=32 \
training.num_epochs=100 \
policy.pretrained_backbone_kwargs.pretrained=true
¿Qué modelo debería utilizar?
Comience con SmolVLA si:
- Su laboratorio tiene GPUs de consumo (RTX 3090 o similares)
- Ya está usando el ecosistema LeRobot .
- Quieres el ciclo de iteración más rápido de la colección de demostración a la inferencia robot
- Su tarea es relativamente estrecha (una mesa, iluminación consistente, objetos conocidos)
Use OpenVLA si:
- Necesitas el mejor rendimiento de generalización de código abierto disponible
- Tienes acceso a una A100 o H100
- Su tarea implica nuevas categorías de objetos o frases de instrucción no vistas durante el entrenamiento
- ¿Quieres que los resultados de los índices de referencia publicados se comparan con
Pi0 se considerará si:
- Necesitas una calidad de manipulación hábil (múltiples dedos, ricos en contacto)
- Estás abierto a trabajar con la Inteligencia Física para ajustar
- Su tarea requiere una frecuencia de control más alta de la que puede proporcionar OpenVLA
Utilice RoboFlamingo si:
- Usted quiere el aprendizaje robótico en contexto (adaptación a nuevas tareas con ejemplos de demostración en la ventana de contexto, sin actualizaciones de gradiente)
- Estás haciendo investigación en generalización de pocos disparos en lugar de optimizar el rendimiento de la tarea
RT-2 de referencia cuando:
- Establecimiento de límites máximos teóricos para el rendimiento de las VLA en un índice de referencia
- Trabajo relacionado con la escritura
es la referencia canónica de VLA - Pero no planee su sistema alrededor de él
no es desplegable
Requisitos de datos para un ajuste fino exitoso
Independientemente del modelo que elija, la calidad de la demostración es la variable más importante.
- Consistencia de colocación de la cámara: El VLA fue pre-entrenado en demostraciones con configuraciones específicas de la cámara.
- Formatos de episodios: HDF5 (compatible con RLDS) o formato nativo de LeRobot. OpenVLA requiere RLDS; SmolVLA prefiere LeRobot. Convertir antes del entrenamiento, no durante.
- ** Anotations de lenguaje:** Cada episodio necesita una cadena de instrucciones de lenguaje natural. Para tareas estrechas, funciona una sola instrucción fija por tarea. Para la generalización, varía la fraseción durante la recopilación.
- Cantidad mínima de demostraciones: SmolVLA: 50+; OpenVLA: 100+; Pi0: 200+ para nuevos tipos de tareas.
Ofrecemos [servicios de recopilación de datos]
Todos los modelos → ACT vs Política de difusión → OpenVLA vs Octo →
Leer sobre la evaluación es una cosa
Ejecutar una evaluación del mundo real → Datos de evaluación de la Comisión → Hardware para su equipo de evaluación →







