Volver a VLA Models

RT-X vs OpenVLA: Comparar los modelos de base para la robótica

Comparar la familia RT-X de Google DeepMind con las arquitecturas OpenVLA 7B <unk>, capacitación Open-X, licencias, acceso, huella de hardware y qué modelo de fundación construir.

La familia RT-X de Google DeepMind dio inicio a la era actual de modelos de base para el control de robots. OpenVLA es la contra-liberación de peso abierto que hizo que los VLA 7B fueran accesibles a todos los laboratorios. ¿En qué debería construir su equipo?

Actualizado abril 2026 Pesos abiertos vs cerrados Ambos Open-X entrenados

[Brasquear todos los modelos] T0) [Obtener una recomendación] T1)

TL;DR RT-X (incluyendo RT-1-X y RT-2-X) es la familia interna de modelos de acción de Google DeepMind, entrenados en Open X-Embodiment. Los puntos de control RT-1-X fueron lanzados bajo Apache 2.0 con código JAX/TF; los modelos RT-2-X y sucesores son propietarios y no están disponibles para el despliegue externo. ** OpenVLA** es el sucesor con licencia MIT 7B construido por la comunidad específicamente porque RT-2-X fue cerrado y superó a RT-2-X en varios puntos de referencia con 7 × menos parámetros. Para cualquier cosa comercial, OpenVLA es la opción realista.

Por qué esta comparación es importante

RT-X es una familia, no un solo modelo, y esa confusión mata muchas conversaciones de adquisiciones. RT-1-X es la política de transformador de parámetro ~35M. Los autores de Open X-Embodiment fueron capacitados y de código abierto para demostrar la transferencia de transmuestos. RT-2-X es el VLA basado en 55B PaLI-X que mostró que los grandes modelos multimodal pueden hacer el control robótico de tiro cero. RT-2-X nunca fue lanzado, y más tarde los modelos de DeepMind (Gemini Robotics, RT-H) se quedaron dentro de Google. Si estás evaluando "RT-X" como base para tu propio sistema, realmente estás evaluando _cuál_punto de control RT-X está disponible generalmente solo RT-1-X contra OpenVLA, que fue publicado de extremo a extremo con pesos, código y adaptadores.

Para una vista más amplia, vea nuestro directorio de modelos VLA, la página RT-X, o la página OpenVLA.

Comparación instantánea

Dimension RT-X family OpenVLA
Parameters RT-1-X ~35M · RT-2-X 55B (PaLI-X based) 7B
Backbone RT-1-X: EfficientNet + token learner + transformer. RT-2-X: PaLI-X multimodal LLM Llama-2 7B + DINOv2 + SigLIP
Action head Discretized action tokens (both variants) Discretized action tokens
Training data Open X-Embodiment (22 embodiments, ~970K traj) Open X-Embodiment (~970K traj)
Language conditioning Strong on RT-2-X, moderate on RT-1-X Strong (LLM-native)
Action space End-effector delta, configurable dim 7-DOF end-effector delta (extensible)
Inference hardware RT-1-X: single GPU. RT-2-X: multi-GPU inference cluster Single A100/H100/L40S bf16
Weights available? RT-1-X: yes. RT-2-X: no (proprietary) Yes, on Hugging Face
License RT-1-X: Apache 2.0. RT-2-X: closed MIT
Fine-tuning RT-1-X fine-tune supported. RT-2-X: no external access LoRA, QLoRA, and full fine-tune recipes published
Paper Open X-Embodiment paper (2023), RT-2 (arXiv:2307.15818) Kim et al., CoRL 2024 (arXiv:2406.09246)
Code github.com/google-deepmind/open_x_embodiment github.com/openvla/openvla

RT-X: la familia que lo comenzó todo

RT-1-X el disponible

RT-1-X es el re-entrenamiento de Open X-Embodiment de la arquitectura original de RT-1 de Google: una columna vertebral visual de EfficientNet, un acondicionador de lenguaje FiLM, un aprendiz de tokens y un transformador que saca acciones discretas. Es pequeño (~ 35M parámetros), rápido y críticamente los pesos están en Hugging Face bajo Apache 2.0. Si su caso de uso es la manipulación móvil con un brazo de Franka o Google Robot y desea un punto de partida ligero, RT-1-X sigue siendo un punto de partida creíble incluso en 2026.

RT-2-X el que no puedes tener

RT-2-X es un VLA 55B basado en PaLI-X que Google entrenó en los mismos datos de Open X-Embodiment. Estableció la tesis de que los grandes VLM pueden hacer el control de robots, pero los pesos nunca se han publicado. Si lees "rendimiento RT-X" en una publicación de blog, comprueba si se refieren al 35M RT-1-X o al 55B RT-2-X la brecha entre los dos es enorme. RT-2-X es una referencia publicada, no un modelo que puedes implementar.

OpenVLA: la respuesta abierta

OpenVLA fue construido explícitamente para cerrar la brecha RT-2-X para la comunidad de código abierto. Es de parámetros 7B lo suficientemente grande como para capturar los antecedentes de lenguaje, lo suficientemente pequeño como para servir en una GPU de gama alta. El [OpenVLA paper] T5) informa que supera a RT-2-X en LIBERO-Spatial, LIBERO-Object, LIBERO-Goal y BridgeData V2 a tiros cero, a pesar de usar 7× menos parámetros. Utiliza un LLM Llama-2 7B con codificadores de visión DINOv2 + SigLIP, discretece las acciones en 256 contenedores por dimensión, y se entrena en el mismo corpus Open X-Embodiment RT-X saw.

Más importante para los constructores: los buques OpenVLA con una receta de ajuste fino LoRA que permite a un equipo adaptar la política a un nuevo robot en un solo A100 de 80 GB en horas en lugar de días.

La cuestión de las licencias y el acceso

Esto es generalmente el factor decisivo. RT-1-X bajo Apache 2.0 es de grado comercial pero viejo y pequeño. RT-2-X no es licenciable en absoluto. OpenVLA bajo MIT es la única manera de obtener el comportamiento de RT-2-class en un paquete comercialmente utilizable. Los equipos que envían robots reales en 2026 especialmente [despliegues de almacén] T6) o [automación de laboratorio] T7) instalaciones que necesitan derechos explícitos casi siempre aterrizan en OpenVLA o uno de sus derivados.

Impresión de la pieza de hardware

RT-1-X se ejecuta en una sola GPU a velocidades en tiempo real y se demostró en una gama de robots desde Franka hasta Google Robot. Es la opción ligera. OpenVLA necesita ~16 GB de VRAM en bfloat16 y normalmente se ejecuta a 510 Hz en un A100 sin cuantización , lo que es bueno para la mayoría de las manipulaciones pero ajustado para el control destre. Los equipos a menudo emparejan OpenVLA con un chunking de acción y un controlador de impedancia de nivel inferior para alcanzar la velocidad de bucle requerida. RT-2-X, si estuviera disponible, necesitaría un servidor de inferencia multi-GPU.

Cuando RT-1-X todavía tiene sentido

  • Quiere la línea de base Open-X más pequeña y rápida y no necesita un fuerte conocimiento del idioma.
  • Está comparando transferencias de encarnaciones cruzadas en un artículo de investigación y quiere una base históricamente basada.
  • Estás funcionando en hardware de borde donde un modelo 7B no es viable.

Cuando OpenVLA es la elección obvia

  • Quieres el comportamiento del lenguaje de clase RT-2 con pesos que puedes descargar.
  • Necesitas un camino de licencia comercial (MIT).
  • Quieres una comunidad activa que envíe adaptadores LoRA, variantes cuantizadas y recetas de despliegue.
  • Usted planea ajustar sus propios datos de teleop La documentación de OpenVLA es materialmente mejor que la de RT-X para su uso en el flujo descendente.

Compromiso honesto

OpenVLA no es estrictamente "mejor" que RT-2-X DeepMind ha continuado empujando los modelos internos más allá de RT-2-X, y la pila de robótica de producción de Google utiliza descendientes cerrados. Si estás construyendo un producto, los pesos MIT de OpenVLA más una tubería de datos alojada en Supabase más [colección de datos de teleoperación]T8) es una pila realista hoy en día.

Indicadores de referencia y evaluación

Ambas familias de modelos publican números en [LIBERO] ((T9), [Google Robot] ((T10), y [RLBench] ((T11). Los números LIBERO de OpenVLA están en el papel y son reproducibles. Los números de RT-X varían según la variante tenga cuidado con la fila RT-X que está citando.

Cuando leas una afirmación de referencia que involucre a RT-X, siempre haz tres preguntas: qué variante de RT-X (RT-1-X o RT-2-X), qué subconjunto de encarnación de Open X-Embodiment se utilizó para la evaluación, y si el robot era la WidowX del mundo real de Google o una reproducción externa. Las evaluaciones de OpenVLA son generalmente más simples de interpretar porque el documento es explícito sobre el punto de control, el protocolo y las divisiones de conjuntos de datos.

Recetas de ajuste y despliegue

Los equipos de aguas abajo que trabajan con RT-1-X suelen ajustar a los conjuntos de tareas más estrechos dentro del paraguas Open X-Embodiment seleccionando solo las trayectorias relevantes para su realización objetivo, luego ejecutando un corto ciclo de entrenamiento para llevar la política a su hardware específico. El código de formación RT-1-X es maduro pero escaso en cuanto a la orientación de producción, y la mayor parte del conocimiento a continuación del proceso se encuentra en los documentos en lugar de en las recetas.

La historia de ajuste fino de OpenVLA es considerablemente más rica. El repositorio oficial envía un ejemplo de ajuste fino de LoRA, un ejemplo de ajuste fino completo, una herramienta de conversión de conjuntos de datos para datos personalizados de RLDS y configuraciones de referencia para varios robots populares. La comunidad ha añadido cuantización de 4 bits, servicio vLLM e integración con LeRobot. Para un equipo que necesita pasar de "tenemos datos de teleop" a "tenemos una política en marcha en nuestro robot" en menos de un mes, las herramientas de OpenVLA son la ventaja decisiva.

Lo que DeepMind está enviando a continuación

Google DeepMind ha continuado iterando el pasado RT-2-X internamente. Gemini Robotics y proyectos relacionados amplían la tesis de base-modelo-para-robótica con VLMs más grandes y un enlace más estrecho con los robots de producción de Google. Ninguno de estos puntos de control se han puesto a disposición para el despliegue externo, por lo que desde la perspectiva de un constructor vale la pena leer sobre ellos pero no vale la pena construir sobre ellos. OpenVLA, pi0 y los modelos del ecosistema LeRobot son el camino realista para el trabajo de código abierto.

Nuestra recomendación

Para casi todos los equipos prácticos de hoy en día, OpenVLA es la respuesta. Hereda intelectualmente el linaje RT-X, coincide o supera a RT-2-X en los puntos de referencia públicos, navega con pesos abiertos bajo MIT y tiene un ecosistema de ajuste fino activo. RT-1-X sigue siendo una pequeña línea de base fina, pero es más probable que utilice [Octo]T14) o una pequeña Política de difusión para ese papel en 2026. RT-2-X es una referencia en papel citarlo, no se basan en él.

Lectura relacionada OpenVLA vs Octo → Política de difusión vs ACT → Mejores modelos de VLA 2026 → Open X-Embodiment dataset → OpenVLA modelo página → RT-X modelo página →

Cada VLA aquí puede ser ajustado a sus propias demostraciones.

Recoge demos → Hardware que lo ejecuta → Corre una política →