Modelos de acción en lenguaje de visión explicados: cómo los VLAs impulsan a los robots modernos
¿Qué son los modelos VLA? Aprenda cómo funcionan los modelos de acción del lenguaje de visión como OpenVLA, pi0 y RT-2, cómo difieren de las políticas clásicas y cómo ajustarlos con datos RCSV.
Parte de: [Guía de aprendizaje por imitación]
Los modelos de acción de lenguaje de visión son el equivalente robótico de redes neuronales masivas y pre-entrenadas GPT-4 que pueden ser ajustadas para realizar una amplia gama de tareas físicas.
Por Jerry Huang, Centro de Robótica del Valle del Silicio
¿Qué es un modelo de acción en el lenguaje de visión?
Un modelo de acción de lenguaje de visión (VLA) es una red neuronal que toma observaciones visuales (imágenes de la cámara) e instrucciones de lenguaje natural como entrada, y saca acciones de robots
La idea principal es que la pre-entrenamiento en los datos de Internet le da al robot una rica representación del mundo físico
Arquitectura VLA: Los tres componentes
Cada VLA comparte la misma arquitectura de tres etapas, aunque las implementaciones difieren significativamente en la forma en que cada etapa se realiza:
1. Codificador de visión: Convierte imágenes de la cámara en una secuencia de tokens visuales. La mayoría de los VLAs utilizan un transformador de visión pre-entrenado (ViT)
2. La columna vertebral con condición de lenguaje: Un modelo de lenguaje grande que procesa los tokens visuales junto con los tokens de instrucción de lenguaje. Aquí es donde ocurre el razonamiento semántico. OpenVLA utiliza LLaMA-2 7B; RT-2 utiliza PaLM-E 55B; pi0 utiliza una columna vertebral 3B personalizada. El tamaño de la columna vertebral determina tanto la capacidad de razonamiento del modelo como su costo de inferencia.
3. Cabeza de acción: Converte la salida de la columna vertebral en acciones específicas para el robot. Esta es la elección de diseño crítica que diferencia las arquitecturas VLA:
- Acciones tokenizadas (RT-2, OpenVLA): Discrete el espacio de acción continua en contenedores (generalmente 256 contenedores por dimensión) y predica tokens de acción utilizando la cabeza de predicción de tokens del modelo de lenguaje. Limitación: la discretization introduce un error de cuantización (~ 0,5 mm en 256 contenedores en un espacio de trabajo de 12 cm) y la predicción de múltiples pasos requiere generación autoregresista, que es lenta.
- ** Regresión de acción continua (Octo):** Agregue una pequeña cabeza de MLP que predica directamente los valores de acción continua.
- ** Cabeza de acción de coincidencia de flujo (pi0):** Modela la distribución de acción como un flujo continuo y muestra de ella utilizando un proceso de denociación similar a la difusión. Produce trayectorias de acción continuas y suaves. Mejor para tareas hábiles, pero agrega 50-100 ms al tiempo de inferencia.
Comparación de los modelos clave
| Model | Parameters | Action Head | Training Data | GPU for Fine-Tune | Inference Latencia | Access |
|---|---|---|---|---|---|---|
| RT-2 | 55B | Tokenized | Google internal + web | TPU v4 pod (not public) | ~1-2s per step | Closed (Google) |
| RT-2-X | 55B | Tokenized | Open X-Embodiment | TPU v4 pod (not public) | ~1-2s per step | Closed (Google) |
| OpenVLA | 7B | Tokenized | Open X-Embodiment (970K eps) | 1x A100 80GB | ~200ms per step | Open source (HuggingFace) |
| Octo | 93M | Continuous (diffusion) | Open X-Embodiment (800K eps) | 1x RTX 4090 24GB | ~50ms per step | Open source (HuggingFace) |
| pi0 | 3B | Flow-matching | Proprietary (10K+ hours) | Enterprise access only | ~100ms per step | Commercial (Physical Intelligence) |
RT-2 y RT-2-X: las líneas de base de Google DeepMind
RT-2 (Robotics Transformer 2), lanzado por Google DeepMind en 2023, fue la primera demostración de que escalar un modelo de lenguaje de visión al control de robots produjo capacidades cualitativamente nuevas. RT-2 co-finó un modelo de lenguaje de visión PaLI-X en datos web y trayectorias de robots simultáneamente, produciendo una política que podía seguir nuevas instrucciones, razonar sobre las propiedades de objetos y generalizar a objetos que nunca había visto en demostraciones de robots
RT-2 mostró que los VLAs podían realizar el razonamiento de cadena de pensamiento: se le pidió que recogiera "algo que pueda usar para limpiar un derrame", el modelo identificó una esponja de la escena sin haber sido explicitamente dicho que asociara las esponjas con la limpieza. Esta capacidad emergente
RT-2-X amplió RT-2 mediante el entrenamiento en el conjunto de datos Open X-Embodiment (demonstrativas de 22 encarnaciones de robots), mostrando que el entrenamiento transversal mejora la generalización. Una política entrenada con datos de múltiples robots funciona mejor en cada robot individual que una política entrenada solo con datos de ese robot
OpenVLA: el punto de partida de código abierto
OpenVLA, lanzado por investigadores de Stanford y Berkeley en 2024, democratizó el ajuste fino de VLA basándose en el Prismatic VLM de código abierto (basado en LLaMA) y la capacitación en el conjunto de datos Open X-Embodiment
La configuración de OpenVLA en una tarea personalizada requiere tan solo 50-200 demostraciones, un conjunto de datos formateado con convenciones HuggingFace LeRobot y una GPU de 80 GB A100 o H100 para una carrera de entrenamiento de varias horas.
# OpenVLA fine-tuning (simplificado) # Requiere: 1x A100 80GB, ~4 horas para 200 demos pip instalar openvla # Formate sus datos en formato LeRobot python scripts/convert_to_lerobot.py \ --input_dir svrc_demos/ \ --output_dir lerobot_dataset/ # Fine-tune OpenVLA en su tarea python finetune.py \model --openvla/openvla-7b \ --dataset lerobot_dataset/ \ --task_name "pick_and_place_cups" \ --epochs 50 --batch size_ 8 \ --e-5 -- \ \ \ \ \ _32 Lo_RA # para evaluar la eficiencia de la memoria de Python.
El servicio de recogida de datos de RCSV produce conjuntos de datos en formato compatible con LeRobot, listos para el ajuste fino de OpenVLA.
Octo: la alternativa ligera
Octo (Ghosh et al., 2024) adopta un enfoque diferente: en lugar de escalar un modelo de lenguaje grande, construye una arquitectura de transformador especialmente construida que sea lo suficientemente pequeña como para funcionar en hardware de materias primas. A los parámetros 93M, Octo es 75 veces más pequeño que OpenVLA y ejecuta inferencias a 50 ms en un RTX 4090
Octo utiliza una cabeza de acción de difusión en lugar de acciones tokenizadas, que produce trayectorias más suaves. Apoya tanto el acondicionamiento del lenguaje como el acondicionamiento de la imagen meta (muéstrarle al robot una imagen del estado final deseado en lugar de describirlo en lenguaje). Para equipos sin acceso A100 o que necesitan inferencia en tiempo real en el hardware de borde, Octo es la opción práctica. El ajuste fino de Octo en 200 demostraciones personalizadas toma aproximadamente 2 horas en un solo RTX 4090.
La compensación: la columna vertebral más pequeña de Octo significa menos comprensión semántica. No puede realizar el razonamiento de cadena de pensamiento que puede RT-2. Para tareas donde la instrucción es simple ("recoger la taza") y la generalización a objetos nuevos no es crítica, el rendimiento de Octo coincide con OpenVLA a una fracción del costo de cálculo. Para las tareas que requieren una comprensión compleja del lenguaje o un razonamiento sobre las propiedades de los objetos, se necesitan OpenVLA o modelos más grandes.
Pi0: La política generalista de la inteligencia física
Pi0, de la Inteligencia Física (pi.ai), representa la frontera comercial del desarrollo de VLA. A diferencia de OpenVLA, que hereda una columna vertebral del modelo de lenguaje, pi0 utiliza una cabeza de acción de coincidencia de flujo que produce trayectorias de acción continuas y suaves más adecuadas para tareas destresas que acciones tokenizadas discretas. pi0 fue entrenado en un conjunto de datos propietario de más de 10.000 horas de demostraciones de robots en docenas de tareas y plataformas de hardware.
Lo que distingue a pi0 arquitectónicamente es la separación entre la vía de razonamiento "lenta" y la vía de control motor reactivo "rápido". Esto refleja las ideas de la ciencia cognitiva sobre los sistemas de control de doble proceso. La vía lenta procesa la instrucción de tarea y la escena actual para producir un plan de alto nivel; la vía rápida genera comandos motores de baja latencia. El resultado es una política que puede manejar tanto el razonamiento de horizonte largo como el control reactivo de alta frecuencia, abriendo la puerta a tareas como lavar ropa plegable, donde ambas son necesarias simultáneamente.
El acceso a pi0 para el despliegue comercial está disponible a través del programa empresarial de Physical Intelligence. Para los equipos que exploran arquitecturas de estilo pi0, los [benchmarks] de RCSV (
Requisitos de datos de formación
Las escalas de rendimiento de VLA con la diversidad de datos pre-entrenamiento y la calidad de datos de ajuste fino específico de tareas.
| Scenario | Fine-Tune Demos | Expected Success Rate | Notes |
|---|---|---|---|
| Zero-shot (no fine-tuning) | 0 | 10-30% | Works only if task is in pre-training distribution |
| Minimal fine-tuning | 10-50 | 40-60% | Sufficient for simple tasks with pre-trained backbone |
| Standard fine-tuning | 50-200 | 70-85% | Sweet spot for most tasks — best ROI on data collection |
| Heavy fine-tuning | 200-1000 | 85-95% | Diminishing returns above 500; variation matters more |
| Specialist fine-tuning | 1000+ | 90-98% | Industrial deployment quality; may overfit to task |
Requisitos críticos de calidad de los datos: las demostraciones deben incluir la instrucción de lenguaje como metadatos, los puntos de vista de la cámara deben coincidir con la configuración de implementación, y las demostraciones deben cubrir toda la gama de poses de objetos y configuraciones de escena que la política encontrará.
Requisitos de inferencia y despliegue
La implementación de VLA es un problema computacional.
- ** Octo (93M params):** Se ejecuta en RTX 4090 (24GB VRAM) a 20 Hz. Se puede implementar en Jetson AGX Orin a 5-8 Hz con optimización TensorRT. El VLA más pequeño que mantiene la generalización entre los cuerpos.
- OpenVLA (7B parámetros): Requiere A100 o H100 (80GB VRAM) para inferir con precisión completa a 5 Hz. Con cuantización de 4 bits (GPTQ o AWQ), se ajusta a RTX 4090 a 3-4 Hz. El ajuste fino de LoRA reduce la memoria a ~ 40GB.
- RT-2 (55B params): Requiere múltiples GPUs A100/H100 con paralelismo tensor. No es práctico para la implementación de un solo robot; se ejecutó originalmente en la infraestructura interna de TPU de Google. Esta es la razón por la cual OpenVLA existe
para proporcionar capacidades de clase RT-2 a escala desplegable. - ** pi0 (3B params):** Optimizado para el despliegue. Se ejecuta en un solo A100 o equivalente a 10 Hz. Physical Intelligence proporciona un servidor de inferencia que maneja solicitudes en lotes para despliegues de múltiples robots.
Para la mayoría de los equipos de investigación, la opción práctica es entre Octo (barato, rápido, menos capaz) y OpenVLA (costo, lento, más capaz). Comience con Octo para validar su tarea y pipeline de datos, luego actualice a OpenVLA si necesita una mejor comprensión del lenguaje o una generalización de objetos novedosos.
El desempenho de tiro cero vs. ajuste fino
Una pregunta clave para los profesionales: ¿cuánto importa el ajuste fino, y cuándo es suficiente el rendimiento de tiro cero?
La foto de cero funciona cuando: la tarea es común (pick-place, cajón abierto/cerrado), los objetos son elementos cotidianos que aparecen en los datos de pre-entrenamiento, el punto de vista de la cámara es similar a los ajustes de investigación estándar (tercero en cabeza o ojo a mano), y la instrucción del idioma es simple y inequívoca.
Es necesario ajustar perfectamente cuando: la tarea implica hardware personalizado o cinemáticas inusuales, los objetos son especializados (equipamiento de laboratorio, piezas industriales), la configuración de la cámara no es estándar, la tarea requiere una precisión superior a la que el modelo previamente entrenado logra, o el entorno de despliegue tiene características visuales únicas (iluminación específica, fondo).
En la práctica, casi todas las implementaciones de producción requieren ajuste fino. El rendimiento de tiro cero proporciona una verificación de cordura útil
Las limitaciones actuales
- ** Latencia de inferencia:** Incluso los VLA más rápidos (Octo a 50 ms) son más lentos que las políticas clásicas (ACT a 10 ms, Política de difusión a 15 ms con DDIM). Para tareas que requieren control de > 30 Hz (ensamblaje sensible a la fuerza, captura reactiva), los VLA son demasiado lentos sin aceleración de hardware dedicada.
- ** Performance en fase de contacto:** Los VLA sobresalen en la fase de aproximación (identificación de objetos, trayectorias de planificación) pero tienen dificultades en la fase de contacto (regulación de la fuerza, inserción, manipulación en la mano). La columna vertebral del lenguaje no proporciona ningún precario útil para la dinámica de contacto.
- Halucinación: Al igual que los modelos de lenguaje, los VLA pueden "allucinar"
prediciendo acciones seguras en situaciones en las que la acción correcta es incierta. Esto se manifiesta como el robot ejecutando un movimiento de agarre cuando no hay objeto agarrable presente, o siguiendo una instrucción que es físicamente imposible. Las capas de seguridad (limites de fuerza, límites del espacio de trabajo) son esenciales. - Costos de capacitación: Pre-entrenamiento de un VLA desde cero requiere millones de demostraciones de robots y cientos de horas de GPU. Incluso ajuste fino de OpenVLA cuesta $50-200 en computación en la nube por carrera de capacitación. Para los equipos que iteran rápidamente en las definiciones de tareas, este costo se suma.
Cómo las VLA difieren de las políticas clásicas de imitación
Las políticas clásicas de IL
VLAs intercambian computación para generalización. Una política ACT clásica en una GPU cuesta centavos por inferencia; un paso de inferencia VLA en un modelo de parámetro 7B cuesta órdenes de magnitud más. Para tareas que necesitan generalizarse ampliamente en entornos e instrucciones, VLAs ganan. Para una tarea industrial repetitiva y estrechamente definida, donde se tienen más de 1.000 demostraciones y se puede ajustar el entorno, una política clásica a menudo logra una mejor velocidad y fiabilidad a menor costo.
VLAs de ajuste fino con datos RCSV
RCSV proporciona soporte de extremo a extremo para proyectos de ajuste fino de VLA. Nuestra [infraestructura de teleoperación]
Para los equipos que necesitan datos personalizados a escala, nuestro servicio de recogida gestionada en las instalaciones de San Francisco puede producir cientos de demostraciones al día con operadores capacitados en una biblioteca de tareas de manipulación. También ofrecemos consulta sobre el diseño de tareas
Relacionado: Aprendizaje por Imitación for Robots · Política de difusión para el aprendizaje de robots · Guía de robots de ALOHA · Servicios de datos · Marcos de referencia







