Volver a Blog

Modelos de acción en lenguaje de visión explicados: cómo los VLAs impulsan a los robots modernos

¿Qué son los modelos VLA? Aprenda cómo funcionan los modelos de acción del lenguaje de visión como OpenVLA, pi0 y RT-2, cómo difieren de las políticas clásicas y cómo ajustarlos con datos RCSV.

Parte de: [Guía de aprendizaje por imitación]

Los modelos de acción de lenguaje de visión son el equivalente robótico de redes neuronales masivas y pre-entrenadas GPT-4 que pueden ser ajustadas para realizar una amplia gama de tareas físicas.

Por Jerry Huang, Centro de Robótica del Valle del Silicio

¿Qué es un modelo de acción en el lenguaje de visión?

Un modelo de acción de lenguaje de visión (VLA) es una red neuronal que toma observaciones visuales (imágenes de la cámara) e instrucciones de lenguaje natural como entrada, y saca acciones de robots velocidades conjuntas, poses de efecto final o comandos de agarre. La parte "idioma de visión" se refiere a la columna vertebral pre-entrenada: estos modelos heredan su comprensión visual y semántica de la pre-entrenamiento a gran escala en Internet en pares de texto-imagen, al igual que CLIP o un modelo de lenguaje de visión (VLM).

La idea principal es que la pre-entrenamiento en los datos de Internet le da al robot una rica representación del mundo físico qué son los objetos, cómo se relacionan espacialmente y qué significa el lenguaje antes de que haya visto una demostración de un robot. Debido a que la columna vertebral ya entiende "recoger la taza azul" o "abrir el cajón a la izquierda", el modelo puede generalizarse a nuevos objetos y frases de tareas con muchas menos demostraciones que una política entrenada desde cero.

Arquitectura VLA: Los tres componentes

Cada VLA comparte la misma arquitectura de tres etapas, aunque las implementaciones difieren significativamente en la forma en que cada etapa se realiza:

1. Codificador de visión: Convierte imágenes de la cámara en una secuencia de tokens visuales. La mayoría de los VLAs utilizan un transformador de visión pre-entrenado (ViT) OpenVLA utiliza SigLIP ViT-L/14 (304M parámetros), RT-2 utiliza ViT-G (1.8B parámetros). El codificador de visión es el componente que se transfiere más directamente desde la pre-entrenamiento de Internet, porque las características visuales aprendidas de las imágenes web (reconocimiento de objetos, diseño espacial, comprensión de la textura) son directamente útiles para la percepción de los robots. La resolución de imagen es importante: 224x224 es estándar pero limita la percepción de granos finos; algunos modelos (pi0) utilizan 384x384 o superior para tareas que requieren precisión visual subcentimetral.

2. La columna vertebral con condición de lenguaje: Un modelo de lenguaje grande que procesa los tokens visuales junto con los tokens de instrucción de lenguaje. Aquí es donde ocurre el razonamiento semántico. OpenVLA utiliza LLaMA-2 7B; RT-2 utiliza PaLM-E 55B; pi0 utiliza una columna vertebral 3B personalizada. El tamaño de la columna vertebral determina tanto la capacidad de razonamiento del modelo como su costo de inferencia.

3. Cabeza de acción: Converte la salida de la columna vertebral en acciones específicas para el robot. Esta es la elección de diseño crítica que diferencia las arquitecturas VLA:

  • Acciones tokenizadas (RT-2, OpenVLA): Discrete el espacio de acción continua en contenedores (generalmente 256 contenedores por dimensión) y predica tokens de acción utilizando la cabeza de predicción de tokens del modelo de lenguaje. Limitación: la discretization introduce un error de cuantización (~ 0,5 mm en 256 contenedores en un espacio de trabajo de 12 cm) y la predicción de múltiples pasos requiere generación autoregresista, que es lenta.
  • ** Regresión de acción continua (Octo):** Agregue una pequeña cabeza de MLP que predica directamente los valores de acción continua.
  • ** Cabeza de acción de coincidencia de flujo (pi0):** Modela la distribución de acción como un flujo continuo y muestra de ella utilizando un proceso de denociación similar a la difusión. Produce trayectorias de acción continuas y suaves. Mejor para tareas hábiles, pero agrega 50-100 ms al tiempo de inferencia.

Comparación de los modelos clave

Model Parameters Action Head Training Data GPU for Fine-Tune Inference Latencia Access
RT-2 55B Tokenized Google internal + web TPU v4 pod (not public) ~1-2s per step Closed (Google)
RT-2-X 55B Tokenized Open X-Embodiment TPU v4 pod (not public) ~1-2s per step Closed (Google)
OpenVLA 7B Tokenized Open X-Embodiment (970K eps) 1x A100 80GB ~200ms per step Open source (HuggingFace)
Octo 93M Continuous (diffusion) Open X-Embodiment (800K eps) 1x RTX 4090 24GB ~50ms per step Open source (HuggingFace)
pi0 3B Flow-matching Proprietary (10K+ hours) Enterprise access only ~100ms per step Commercial (Physical Intelligence)

RT-2 y RT-2-X: las líneas de base de Google DeepMind

RT-2 (Robotics Transformer 2), lanzado por Google DeepMind en 2023, fue la primera demostración de que escalar un modelo de lenguaje de visión al control de robots produjo capacidades cualitativamente nuevas. RT-2 co-finó un modelo de lenguaje de visión PaLI-X en datos web y trayectorias de robots simultáneamente, produciendo una política que podía seguir nuevas instrucciones, razonar sobre las propiedades de objetos y generalizar a objetos que nunca había visto en demostraciones de robots solo en Internet.

RT-2 mostró que los VLAs podían realizar el razonamiento de cadena de pensamiento: se le pidió que recogiera "algo que pueda usar para limpiar un derrame", el modelo identificó una esponja de la escena sin haber sido explicitamente dicho que asociara las esponjas con la limpieza. Esta capacidad emergente generalización semántica más allá de la distribución de la formación es lo que hace que los VLA sean cualitativamente diferentes de las políticas clásicas de aprendizaje por imitación.

RT-2-X amplió RT-2 mediante el entrenamiento en el conjunto de datos Open X-Embodiment (demonstrativas de 22 encarnaciones de robots), mostrando que el entrenamiento transversal mejora la generalización. Una política entrenada con datos de múltiples robots funciona mejor en cada robot individual que una política entrenada solo con datos de ese robot análogo a cómo los modelos de lenguaje multilingües superan a los monolingües.

OpenVLA: el punto de partida de código abierto

OpenVLA, lanzado por investigadores de Stanford y Berkeley en 2024, democratizó el ajuste fino de VLA basándose en el Prismatic VLM de código abierto (basado en LLaMA) y la capacitación en el conjunto de datos Open X-Embodiment una colección de 970k episodios de demostraciones de robots de 22 encarnaciones diferentes. OpenVLA es el punto de partida que la mayoría de los equipos de investigación utilizan hoy en día porque es totalmente de código abierto, bien documentado y logra un buen rendimiento en los criterios de referencia de manipulación estándar.

La configuración de OpenVLA en una tarea personalizada requiere tan solo 50-200 demostraciones, un conjunto de datos formateado con convenciones HuggingFace LeRobot y una GPU de 80 GB A100 o H100 para una carrera de entrenamiento de varias horas.

# OpenVLA fine-tuning (simplificado) # Requiere: 1x A100 80GB, ~4 horas para 200 demos pip instalar openvla # Formate sus datos en formato LeRobot python scripts/convert_to_lerobot.py \ --input_dir svrc_demos/ \ --output_dir lerobot_dataset/ # Fine-tune OpenVLA en su tarea python finetune.py \model --openvla/openvla-7b \ --dataset lerobot_dataset/ \ --task_name "pick_and_place_cups" \ --epochs 50 --batch size_ 8 \ --e-5 -- \ \ \ \ \ _32 Lo_RA # para evaluar la eficiencia de la memoria de Python.

El servicio de recogida de datos de RCSV produce conjuntos de datos en formato compatible con LeRobot, listos para el ajuste fino de OpenVLA.

Octo: la alternativa ligera

Octo (Ghosh et al., 2024) adopta un enfoque diferente: en lugar de escalar un modelo de lenguaje grande, construye una arquitectura de transformador especialmente construida que sea lo suficientemente pequeña como para funcionar en hardware de materias primas. A los parámetros 93M, Octo es 75 veces más pequeño que OpenVLA y ejecuta inferencias a 50 ms en un RTX 4090 lo suficientemente rápido como para el control en tiempo real a 20 Hz.

Octo utiliza una cabeza de acción de difusión en lugar de acciones tokenizadas, que produce trayectorias más suaves. Apoya tanto el acondicionamiento del lenguaje como el acondicionamiento de la imagen meta (muéstrarle al robot una imagen del estado final deseado en lugar de describirlo en lenguaje). Para equipos sin acceso A100 o que necesitan inferencia en tiempo real en el hardware de borde, Octo es la opción práctica. El ajuste fino de Octo en 200 demostraciones personalizadas toma aproximadamente 2 horas en un solo RTX 4090.

La compensación: la columna vertebral más pequeña de Octo significa menos comprensión semántica. No puede realizar el razonamiento de cadena de pensamiento que puede RT-2. Para tareas donde la instrucción es simple ("recoger la taza") y la generalización a objetos nuevos no es crítica, el rendimiento de Octo coincide con OpenVLA a una fracción del costo de cálculo. Para las tareas que requieren una comprensión compleja del lenguaje o un razonamiento sobre las propiedades de los objetos, se necesitan OpenVLA o modelos más grandes.

Pi0: La política generalista de la inteligencia física

Pi0, de la Inteligencia Física (pi.ai), representa la frontera comercial del desarrollo de VLA. A diferencia de OpenVLA, que hereda una columna vertebral del modelo de lenguaje, pi0 utiliza una cabeza de acción de coincidencia de flujo que produce trayectorias de acción continuas y suaves más adecuadas para tareas destresas que acciones tokenizadas discretas. pi0 fue entrenado en un conjunto de datos propietario de más de 10.000 horas de demostraciones de robots en docenas de tareas y plataformas de hardware.

Lo que distingue a pi0 arquitectónicamente es la separación entre la vía de razonamiento "lenta" y la vía de control motor reactivo "rápido". Esto refleja las ideas de la ciencia cognitiva sobre los sistemas de control de doble proceso. La vía lenta procesa la instrucción de tarea y la escena actual para producir un plan de alto nivel; la vía rápida genera comandos motores de baja latencia. El resultado es una política que puede manejar tanto el razonamiento de horizonte largo como el control reactivo de alta frecuencia, abriendo la puerta a tareas como lavar ropa plegable, donde ambas son necesarias simultáneamente.

El acceso a pi0 para el despliegue comercial está disponible a través del programa empresarial de Physical Intelligence. Para los equipos que exploran arquitecturas de estilo pi0, los [benchmarks] de RCSV (T2) incluyen evaluaciones de políticas de coincidencia de flujo en suites de manipulación estándar, dándole un punto de referencia para el rendimiento esperado antes de comprometerse con una carrera de entrenamiento.

Requisitos de datos de formación

Las escalas de rendimiento de VLA con la diversidad de datos pre-entrenamiento y la calidad de datos de ajuste fino específico de tareas.

Scenario Fine-Tune Demos Expected Success Rate Notes
Zero-shot (no fine-tuning) 0 10-30% Works only if task is in pre-training distribution
Minimal fine-tuning 10-50 40-60% Sufficient for simple tasks with pre-trained backbone
Standard fine-tuning 50-200 70-85% Sweet spot for most tasks — best ROI on data collection
Heavy fine-tuning 200-1000 85-95% Diminishing returns above 500; variation matters more
Specialist fine-tuning 1000+ 90-98% Industrial deployment quality; may overfit to task

Requisitos críticos de calidad de los datos: las demostraciones deben incluir la instrucción de lenguaje como metadatos, los puntos de vista de la cámara deben coincidir con la configuración de implementación, y las demostraciones deben cubrir toda la gama de poses de objetos y configuraciones de escena que la política encontrará.

Requisitos de inferencia y despliegue

La implementación de VLA es un problema computacional.

  • ** Octo (93M params):** Se ejecuta en RTX 4090 (24GB VRAM) a 20 Hz. Se puede implementar en Jetson AGX Orin a 5-8 Hz con optimización TensorRT. El VLA más pequeño que mantiene la generalización entre los cuerpos.
  • OpenVLA (7B parámetros): Requiere A100 o H100 (80GB VRAM) para inferir con precisión completa a 5 Hz. Con cuantización de 4 bits (GPTQ o AWQ), se ajusta a RTX 4090 a 3-4 Hz. El ajuste fino de LoRA reduce la memoria a ~ 40GB.
  • RT-2 (55B params): Requiere múltiples GPUs A100/H100 con paralelismo tensor. No es práctico para la implementación de un solo robot; se ejecutó originalmente en la infraestructura interna de TPU de Google. Esta es la razón por la cual OpenVLA existe para proporcionar capacidades de clase RT-2 a escala desplegable.
  • ** pi0 (3B params):** Optimizado para el despliegue. Se ejecuta en un solo A100 o equivalente a 10 Hz. Physical Intelligence proporciona un servidor de inferencia que maneja solicitudes en lotes para despliegues de múltiples robots.

Para la mayoría de los equipos de investigación, la opción práctica es entre Octo (barato, rápido, menos capaz) y OpenVLA (costo, lento, más capaz). Comience con Octo para validar su tarea y pipeline de datos, luego actualice a OpenVLA si necesita una mejor comprensión del lenguaje o una generalización de objetos novedosos.

El desempenho de tiro cero vs. ajuste fino

Una pregunta clave para los profesionales: ¿cuánto importa el ajuste fino, y cuándo es suficiente el rendimiento de tiro cero?

La foto de cero funciona cuando: la tarea es común (pick-place, cajón abierto/cerrado), los objetos son elementos cotidianos que aparecen en los datos de pre-entrenamiento, el punto de vista de la cámara es similar a los ajustes de investigación estándar (tercero en cabeza o ojo a mano), y la instrucción del idioma es simple y inequívoca.

Es necesario ajustar perfectamente cuando: la tarea implica hardware personalizado o cinemáticas inusuales, los objetos son especializados (equipamiento de laboratorio, piezas industriales), la configuración de la cámara no es estándar, la tarea requiere una precisión superior a la que el modelo previamente entrenado logra, o el entorno de despliegue tiene características visuales únicas (iluminación específica, fondo).

En la práctica, casi todas las implementaciones de producción requieren ajuste fino. El rendimiento de tiro cero proporciona una verificación de cordura útil si el VLA no puede realizar la tarea en absoluto en modo de tiro cero, ya sea la tarea está muy lejos de la distribución de entrenamiento (que requiere una gran cantidad de datos de ajuste fino) o la tarea puede ser mejor atendida por un enfoque no VLA.

Las limitaciones actuales

  • ** Latencia de inferencia:** Incluso los VLA más rápidos (Octo a 50 ms) son más lentos que las políticas clásicas (ACT a 10 ms, Política de difusión a 15 ms con DDIM). Para tareas que requieren control de > 30 Hz (ensamblaje sensible a la fuerza, captura reactiva), los VLA son demasiado lentos sin aceleración de hardware dedicada.
  • ** Performance en fase de contacto:** Los VLA sobresalen en la fase de aproximación (identificación de objetos, trayectorias de planificación) pero tienen dificultades en la fase de contacto (regulación de la fuerza, inserción, manipulación en la mano). La columna vertebral del lenguaje no proporciona ningún precario útil para la dinámica de contacto.
  • Halucinación: Al igual que los modelos de lenguaje, los VLA pueden "allucinar" prediciendo acciones seguras en situaciones en las que la acción correcta es incierta. Esto se manifiesta como el robot ejecutando un movimiento de agarre cuando no hay objeto agarrable presente, o siguiendo una instrucción que es físicamente imposible. Las capas de seguridad (limites de fuerza, límites del espacio de trabajo) son esenciales.
  • Costos de capacitación: Pre-entrenamiento de un VLA desde cero requiere millones de demostraciones de robots y cientos de horas de GPU. Incluso ajuste fino de OpenVLA cuesta $50-200 en computación en la nube por carrera de capacitación. Para los equipos que iteran rápidamente en las definiciones de tareas, este costo se suma.

Cómo las VLA difieren de las políticas clásicas de imitación

Las políticas clásicas de IL ACT, [Difusion Policy]T3), BC-Z aprenden enteramente a partir de los datos de demostración de robots. Sus representaciones visuales se aprenden desde cero o a partir de un estrecho codificador pre-entrenado (como R3M o MVP). Se generalizan bien dentro de su distribución de entrenamiento, pero luchan con nuevos objetos, cambios de iluminación o instrucciones de tareas que reformula la meta. También requieren más demostraciones para alcanzar un determinado nivel de rendimiento porque carecen del previo semántico que proporciona la pre-entrenamiento.

VLAs intercambian computación para generalización. Una política ACT clásica en una GPU cuesta centavos por inferencia; un paso de inferencia VLA en un modelo de parámetro 7B cuesta órdenes de magnitud más. Para tareas que necesitan generalizarse ampliamente en entornos e instrucciones, VLAs ganan. Para una tarea industrial repetitiva y estrechamente definida, donde se tienen más de 1.000 demostraciones y se puede ajustar el entorno, una política clásica a menudo logra una mejor velocidad y fiabilidad a menor costo.

VLAs de ajuste fino con datos RCSV

RCSV proporciona soporte de extremo a extremo para proyectos de ajuste fino de VLA. Nuestra [infraestructura de teleoperación] T4) captura demostraciones en formato RLDS/LeRobot con video sincronizado multi-camera, estado propioceptivo y etiquetas de acción a 50Hz. Nuestras líneas de datos incluyen filtración de calidad de los episodios (eliminación de intentos fallidos y dudas), metadatos de calibración de la cámara y anotación de instrucciones de tarea todos los metadatos que los VLA necesitan para un ajuste fino efectivo.

Para los equipos que necesitan datos personalizados a escala, nuestro servicio de recogida gestionada en las instalaciones de San Francisco puede producir cientos de demostraciones al día con operadores capacitados en una biblioteca de tareas de manipulación. También ofrecemos consulta sobre el diseño de tareas definiendo el alcance, los ejes de variación y los criterios de éxito de un conjunto de datos que entrenará una política generalizable. Los proyectos piloto comienzan en $2,500 para 200 demostraciones; campañas completas en $8,000 para más de 1,000 demostraciones. Contacta con nuestro equipo para discutir tu proyecto de ajuste fino de VLA, o explorar nuestro catálogo de conjuntos de datos existentes a través de la plataforma RCSV.

Relacionado: Aprendizaje por Imitación for Robots · Política de difusión para el aprendizaje de robots · Guía de robots de ALOHA · Servicios de datos · Marcos de referencia