Volver a VLA Models

Mejores modelos de VLA 2026: Guía completa de visión-linguego-acción

Los 8 mejores modelos de visión-lenguaje-acción para la robótica en 2026 <unk> OpenVLA, Octo, pi0, RT-X, Política de difusión, ACT <unk> clasificados con licencias, hardware y notas de ajuste.

Los 8 modelos de acción y imitación de lenguaje de visión que recomendamos en 2026 con notas honestas sobre licencias, huella de hardware, fidelidad de lenguaje y adaptación a la producción.

Actualizado abril 2026 8 modelos clasificados Pesos abiertos priorizados

[Brasquear todos los modelos] T0) [Obtener una recomendación] T1)

TL;DR Nuestras mejores selecciones de 2026, clasificadas: 1. OpenVLA (mejor VLA de peso abierto integral) · 2. Octo (mejor política de difusión compacta) · 3. pi0 (mejor versión de Inteligencia Física) · 4. RT-1-X (mejor línea de base histórica pequeña) · 5. Política de difusión (mejor algoritmo de aprendizaje de imitación para demostraciones multimodal) · 6. ACT (mejor para teleop bimanual) · 7. InternVLA-M1 (mejor VLA de tierra espacial del laboratorio de IA de Shanghai) · 8. SmolVLA (mejor VLA ligero bajo el paraguas LeRobot).

¿Qué hace que un modelo VLA sea "mejor" en 2026?

El panorama de VLA ha madurado rápidamente. Hace dos años, "mejor" significaba "cualquier modelo que funcione en absoluto". Hoy, con OpenVLA, Octo, pi0, InternVLA-M1, y una docena de variantes de investigación que envían pesos abiertos, la pregunta es qué modelo se adapta a tu implementación.

  • Open Weights & License. ¿Puedes descargarlo, ajustarlo y enviarlo comercialmente? MIT y Apache 2.0 son las licencias seguras.
  • ¿Se ejecuta en un solo A100? 4090? Una caja de borde? Esto decide tu BOM.
  • Fidelidad del lenguaje. ¿Qué tan bien sigue las instrucciones de forma libre frente al colapso de frases de entrenamiento?
  • Costo de ajuste fino. ¿Puedes adaptarlo a tu robot en un día o requiere entrenamiento multi-nodo?
  • Maturez de producción. ¿Existen recetas LoRA, variantes cuantificadas y una comunidad que los envíos arreglan?

El ranking de 2026

  1. OpenVLA mejor fundación de peso abierto VLA

7B ParamsMITOpen X-EmbodimentA100-clase GPU

La VLA predeterminada para 2026. Llama-2 7B espina dorsal, visión DINOv2 + SigLIP, tokens de acción discreta, entrenados en 970K Open X-Embodiment trayectorias. Superó RT-2-X en LIBERO con 7× menos parámetros. La comunidad activa envío adaptadores LoRA y variantes cuantizadas. Ver la [OpenVLA modelo página]

  1. Octo mejor VLA de difusión compacta

27M / 93MMITOpen X-EmbodimentGPU del consumidor

La política de difusión de transformador entrenada desde cero en ~800K trayectorias Open X. Se ejecuta en una sola RTX 4090 a 2030 Hz. Espacio de acción flexible, acondicionamiento de imagen objetivo y ajuste fino directo. La alternativa delgada cuando no puedes pagar un modelo 7B. Ver [Octo]

  1. Pi0 (inteligencia física) mejor generalista de próxima generación

MultimilionarioPublicado parcialmenteCustom corpus

El generalista insignia de la Inteligencia Física VLA introdujo una cabeza de acción de coincidencia de flujo y un enfoque en tareas hábiles y de largo horizonte.

  1. RT-1-X mejor base histórica pequeña

~ 35MApache 2.0O abierto X-embodiment GPU único

El reentrenamiento de Open X-Embodiment de RT-1. pequeño, rápido, transversal. Un baseline creíble de peso ligero para los trabajos de investigación. Para las implementaciones de productos, se prefiere Octo pero RT-1-X sigue siendo la referencia histórica canónica. Ver [RT-X]T5).

  1. Política de difusión mejor aprendizaje de imitación para demostraciones multimodal

CNN/transformador espaldaMITDDPM cabeza de acción

La Política de difusión de Columbia es la línea de referencia cuando las demostraciones de expertos son multimodal. Mejora promedio del 46,9% con respecto a los métodos de aprendizaje de imitación anteriores en la publicación. Apto natural para la manipulación rica en contacto y cualquier entorno en el que las estrategias promedio colapsarían el comportamiento. Ver [Política de difusión]T6) o nuestra [Política de difusión vs comparación ACT]T7).

  1. ACT mejor aprendizaje de imitación para teleop bimanual

Transformador CVAEMITAción de la pieza

El programa de formación de la tecnología de telecomunicaciones (LEB) se desarrolla en un sistema de control de datos de computadoras de alta velocidad (GPU) y de alta velocidad (GPU).

  1. InternVLA-M1 mejor VLA abierto con tierra espacial

Peso abiertoMITGrounding + acción

VLA de dos etapas del Shanghai AI Lab que utiliza la conexión a tierra espacial como representación intermedia antes de la predicción de la acción. Informó 7181% en Google Robot y 95.9% en LIBERO, entre los números de peso abierto más fuertes publicados en 2025. Ver [InternVLA-M1]T9).

  1. SmolVLA mejor VLA ligero en el ecosistema LeRobot

450MApache 2.0 Cara de acogida

Hugging Face es un VLA compacto lanzado bajo el marco LeRobot. Diseñado para funcionar en computadoras portátiles y robots de grado aficionado, con carga y capacitación de datos integrados a través de las tuberías de LeRobot. Un buen punto de entrada si desea un VLA que se ejecuta sin una GPU de centro de datos. Ver LeRobot.

Resumen lado a lado

Model Params License Action head Hardware Best for
OpenVLA 7B MIT Discretized tokens A100/H100 Language-grounded manipulation
Octo 27M / 93M MIT Diffusion RTX 4090 Cross-embodiment, high freq
pi0 Multi-B Partial Flow matching Multi-GPU Dexterous long-horizon
RT-1-X ~35M Apache 2.0 Discretized tokens Single GPU Small historical baseline
Diffusion Policy Configurable MIT DDPM chunks Single GPU Multi-modal imitation
ACT Configurable MIT CVAE chunks Single GPU Bimanual teleop
InternVLA-M1 Open MIT Grounded action A100 Spatially precise tasks
SmolVLA 450M Apache 2.0 Chunked Laptop GPU Hobby / edge robots

Cómo elegir para su despliegue

La respuesta honesta es que la mayoría de los equipos en 2026 ejecutan dos modelos: una base VLA como el frente de la lengua a la tarea, y una estrecha política de aprendizaje de imitación como la cabeza de acción precisa. OpenVLA + Política de difusión, o Octo + ACT, son combinaciones comunes. Para un árbol de decisión basado en el tipo de tarea y hardware, vea nuestra guía sobre cómo elegir un modelo robot.

Si todavía está recopilando datos de teleop, sea socio de nuestros [servicios de datos de teleoperación]T12) el formato demo importa más que la elección del algoritmo. Si ya tiene demostraciones, déjanos una nota con el formato y le diremos con cuál de los ocho modelos anteriores empezar.

Lo que cambió entre 2024 y 2026

Tres cambios definen el panorama actual de VLA. Primero, ** pesos abiertos alcanzados por pesos cerrados**. En 2023 la conversación fue dominada por RT-2 y otros modelos de DeepMind propietarios. Para 2026, OpenVLA, Octo, pi0 lanzamientos parciales, y InternVLA-M1 juntos cubren la mayoría de las capacidades que un equipo de producción realmente usaría. Los modelos cerrados siguen liderando en la frontera, pero la brecha para los puestos de control abiertos desplegables se ha reducido dramáticamente.

En segundo lugar, los primitivos de imitación-aprendizaje se convirtieron en la columna vertebral del modelo de fundación. La cabeza de acción de la Política de difusión ahora está dentro de Octubre. La estrategia de desmontaje y ensamblaje de ACT es estándar en todo el campo. La división limpia entre "investigación IL" y "despliegue VLA" se ha desdibujado en una pila de capas donde cada nivel toma prestados trucos de la nivel inferior.

En tercer lugar, ** datos se convirtió en el cuello de botella**. Con tantos modelos abiertos capaces, el diferenciador es la calidad y la cobertura de su propio corpus de teleop. Los equipos que invirtieron en la recopilación de datos disciplinados hasta 2025 colocación de cámaras consistentes, anotaciones limpias, una taxonomía sensata de subtareas desbloquearon mejor a la corriente que los equipos que trataron los datos como una postventa. Nuestros servicios de [custom-collection] (T13) y [anotamiento] (T14) existen precisamente porque aquí es donde vive la actual influencia.

Modelos notables que deliberadamente omitimos de la lista

Algunos modelos aparecen en cada encuesta, pero no ganaron una ranura de ocho en 2026. RoboFlamingo y BridgeVLA son notorios en la investigación pero más estrechos en el alcance de implementación que las opciones anteriores. RT-2-X no es descargable, por lo que no puede clasificarse en comparación con los modelos que realmente puede usar. Gemini Robotics y otros sucesores de DeepMind están cerrados. Las ofertas de propiedad de varios laboratorios comerciales son interesantes pero te bloquean en puntos finales de nube específicos los clasificamos por separado en nuestro asesoramiento empresarial.

Si alguno de estos casos coincide mejor con su caso de uso que nuestro top 8, preferimos que elija el modelo correcto que el clasificado.

Preguntas frecuentes

¿Qué es un modelo de acción en lenguaje de visión (VLA)?

Un modelo de visión-lenguaje-acción (VLA) es una red neuronal que ingere imágenes de la cámara y una instrucción de lenguaje natural y produce acciones robóticas (comandos conjuntos o de efectores finales). OpenVLA, Octo y RT-2-X son los ejemplos canónicos.

¿Con qué modelo VLA debería empezar en 2026?

Para la mayoría de los equipos de código abierto en 2026, OpenVLA (7B, licencia MIT, entrenada en Open X-Embodiment) es el punto de partida predeterminado. Si está implementando en hardware de consumo, Octo-Base (93M) es una alternativa más ligera. Si está haciendo aprendizaje de imitación pura en datos de teleop, comience con ACT para tareas bimanual o Política de difusión para tareas de un solo brazo multimodal.

¿Qué hardware necesito para ejecutar OpenVLA?

OpenVLA en bfloat16 necesita aproximadamente 16 GB de memoria GPU. En la práctica, los equipos se desplegan en un solo A100 (40 o 80 GB), H100 o L40S para inferir en tiempo real a 510 Hz. Una variante cuantizada de 4 bits puede ejecutarse en un RTX 4090 de 24 GB con modestas penas de velocidad.

¿Están disponibles los pesos de los modelos RT-X?

RT-1-X pesos se lanzan bajo Apache 2.0 y están en Hugging Face. RT-2-X pesos no se lanzan públicamente y nunca han sido disponibles fuera de Google DeepMind. Por esta razón, la mayoría de las implementaciones prácticas que quieren el comportamiento de clase RT-2 utilizan OpenVLA, que está licenciado por MIT y alojado públicamente.

¿Puedo ajustar un modelo VLA en mis propios datos?

Sí. OpenVLA se envía con LoRA y recetas de ajuste fino completas que adaptan la política a un nuevo robot o tarea en horas en un solo A100. Octo admite ajuste fino completo en una sola GPU de 24 GB. ACT y Política de difusión se entrenan comúnmente desde cero en 50200 demostraciones de teleópticos y no requieren un modelo de base en absoluto. Los servicios de datos de teleoperatoria del RCSV pueden ayudarle a recopilar el corpus de demostración.

Lectura relacionada OpenVLA vs Octo → RT-X vs OpenVLA → Política de difusión vs ACT → directorio de modelos VLA → Open X-Embodiment dataset → LIBERO benchmark → [Recolección de datos de la Teleópia →]T21)

Cada VLA aquí puede ser ajustado a sus propias demostraciones.

Recoge demos → Hardware que lo ejecuta → Corre una política →