RT-X vs OpenVLA: Comparar los modelos de base para la robótica
Comparar la familia RT-X de Google DeepMind con las arquitecturas OpenVLA 7B <unk>, capacitación Open-X, licencias, acceso, huella de hardware y qué modelo de fundación construir.
La familia RT-X de Google DeepMind dio inicio a la era actual de modelos de base para el control de robots. OpenVLA es la contra-liberación de peso abierto que hizo que los VLA 7B fueran accesibles a todos los laboratorios. ¿En qué debería construir su equipo?
Actualizado abril 2026 Pesos abiertos vs cerrados Ambos Open-X entrenados
[Brasquear todos los modelos]
TL;DR RT-X (incluyendo RT-1-X y RT-2-X) es la familia interna de modelos de acción de Google DeepMind, entrenados en Open X-Embodiment. Los puntos de control RT-1-X fueron lanzados bajo Apache 2.0 con código JAX/TF; los modelos RT-2-X y sucesores son propietarios y no están disponibles para el despliegue externo. ** OpenVLA** es el sucesor con licencia MIT 7B construido por la comunidad específicamente porque RT-2-X fue cerrado
Por qué esta comparación es importante
RT-X es una familia, no un solo modelo, y esa confusión mata muchas conversaciones de adquisiciones. RT-1-X es la política de transformador de parámetro ~35M. Los autores de Open X-Embodiment fueron capacitados y de código abierto para demostrar la transferencia de transmuestos. RT-2-X es el VLA basado en 55B PaLI-X que mostró que los grandes modelos multimodal pueden hacer el control robótico de tiro cero. RT-2-X nunca fue lanzado, y más tarde los modelos de DeepMind (Gemini Robotics, RT-H) se quedaron dentro de Google. Si estás evaluando "RT-X" como base para tu propio sistema, realmente estás evaluando _cuál_punto de control RT-X está disponible
Para una vista más amplia, vea nuestro directorio de modelos VLA, la página RT-X, o la página OpenVLA.
Comparación instantánea
| Dimension | RT-X family | OpenVLA |
|---|---|---|
| Parameters | RT-1-X ~35M · RT-2-X 55B (PaLI-X based) | 7B |
| Backbone | RT-1-X: EfficientNet + token learner + transformer. RT-2-X: PaLI-X multimodal LLM | Llama-2 7B + DINOv2 + SigLIP |
| Action head | Discretized action tokens (both variants) | Discretized action tokens |
| Training data | Open X-Embodiment (22 embodiments, ~970K traj) | Open X-Embodiment (~970K traj) |
| Language conditioning | Strong on RT-2-X, moderate on RT-1-X | Strong (LLM-native) |
| Action space | End-effector delta, configurable dim | 7-DOF end-effector delta (extensible) |
| Inference hardware | RT-1-X: single GPU. RT-2-X: multi-GPU inference cluster | Single A100/H100/L40S bf16 |
| Weights available? | RT-1-X: yes. RT-2-X: no (proprietary) | Yes, on Hugging Face |
| License | RT-1-X: Apache 2.0. RT-2-X: closed | MIT |
| Fine-tuning | RT-1-X fine-tune supported. RT-2-X: no external access | LoRA, QLoRA, and full fine-tune recipes published |
| Paper | Open X-Embodiment paper (2023), RT-2 (arXiv:2307.15818) | Kim et al., CoRL 2024 (arXiv:2406.09246) |
| Code | github.com/google-deepmind/open_x_embodiment | github.com/openvla/openvla |
RT-X: la familia que lo comenzó todo
RT-1-X el disponible
RT-1-X es el re-entrenamiento de Open X-Embodiment de la arquitectura original de RT-1 de Google: una columna vertebral visual de EfficientNet, un acondicionador de lenguaje FiLM, un aprendiz de tokens y un transformador que saca acciones discretas. Es pequeño (~ 35M parámetros), rápido y
RT-2-X el que no puedes tener
RT-2-X es un VLA 55B basado en PaLI-X que Google entrenó en los mismos datos de Open X-Embodiment. Estableció la tesis de que los grandes VLM pueden hacer el control de robots, pero los pesos nunca se han publicado. Si lees "rendimiento RT-X" en una publicación de blog, comprueba si se refieren al 35M RT-1-X o al 55B RT-2-X
OpenVLA: la respuesta abierta
OpenVLA fue construido explícitamente para cerrar la brecha RT-2-X para la comunidad de código abierto. Es de parámetros 7B
Más importante para los constructores: los buques OpenVLA con una receta de ajuste fino LoRA que permite a un equipo adaptar la política a un nuevo robot en un solo A100 de 80 GB en horas en lugar de días.
La cuestión de las licencias y el acceso
Esto es generalmente el factor decisivo. RT-1-X bajo Apache 2.0 es de grado comercial pero viejo y pequeño. RT-2-X no es licenciable en absoluto. OpenVLA bajo MIT es la única manera de obtener el comportamiento de RT-2-class en un paquete comercialmente utilizable. Los equipos que envían robots reales en 2026
Impresión de la pieza de hardware
RT-1-X se ejecuta en una sola GPU a velocidades en tiempo real y se demostró en una gama de robots desde Franka hasta Google Robot. Es la opción ligera. OpenVLA necesita ~16 GB de VRAM en bfloat16 y normalmente se ejecuta a 5
Cuando RT-1-X todavía tiene sentido
- Quiere la línea de base Open-X más pequeña y rápida y no necesita un fuerte conocimiento del idioma.
- Está comparando transferencias de encarnaciones cruzadas en un artículo de investigación y quiere una base históricamente basada.
- Estás funcionando en hardware de borde donde un modelo 7B no es viable.
Cuando OpenVLA es la elección obvia
- Quieres el comportamiento del lenguaje de clase RT-2 con pesos que puedes descargar.
- Necesitas un camino de licencia comercial (MIT).
- Quieres una comunidad activa que envíe adaptadores LoRA, variantes cuantizadas y recetas de despliegue.
- Usted planea ajustar sus propios datos de teleop
La documentación de OpenVLA es materialmente mejor que la de RT-X para su uso en el flujo descendente.
Compromiso honesto
OpenVLA no es estrictamente "mejor" que RT-2-X
Indicadores de referencia y evaluación
Ambas familias de modelos publican números en [LIBERO] ((
Cuando leas una afirmación de referencia que involucre a RT-X, siempre haz tres preguntas: qué variante de RT-X (RT-1-X o RT-2-X), qué subconjunto de encarnación de Open X-Embodiment se utilizó para la evaluación, y si el robot era la WidowX del mundo real de Google o una reproducción externa. Las evaluaciones de OpenVLA son generalmente más simples de interpretar porque el documento es explícito sobre el punto de control, el protocolo y las divisiones de conjuntos de datos.
Recetas de ajuste y despliegue
Los equipos de aguas abajo que trabajan con RT-1-X suelen ajustar a los conjuntos de tareas más estrechos dentro del paraguas Open X-Embodiment
La historia de ajuste fino de OpenVLA es considerablemente más rica. El repositorio oficial envía un ejemplo de ajuste fino de LoRA, un ejemplo de ajuste fino completo, una herramienta de conversión de conjuntos de datos para datos personalizados de RLDS y configuraciones de referencia para varios robots populares. La comunidad ha añadido cuantización de 4 bits, servicio vLLM e integración con LeRobot. Para un equipo que necesita pasar de "tenemos datos de teleop" a "tenemos una política en marcha en nuestro robot" en menos de un mes, las herramientas de OpenVLA son la ventaja decisiva.
Lo que DeepMind está enviando a continuación
Google DeepMind ha continuado iterando el pasado RT-2-X internamente. Gemini Robotics y proyectos relacionados amplían la tesis de base-modelo-para-robótica con VLMs más grandes y un enlace más estrecho con los robots de producción de Google. Ninguno de estos puntos de control se han puesto a disposición para el despliegue externo, por lo que desde la perspectiva de un constructor vale la pena leer sobre ellos pero no vale la pena construir sobre ellos. OpenVLA, pi0 y los modelos del ecosistema LeRobot son el camino realista para el trabajo de código abierto.
Nuestra recomendación
Para casi todos los equipos prácticos de hoy en día, OpenVLA es la respuesta. Hereda intelectualmente el linaje RT-X, coincide o supera a RT-2-X en los puntos de referencia públicos, navega con pesos abiertos bajo MIT y tiene un ecosistema de ajuste fino activo. RT-1-X sigue siendo una pequeña línea de base fina, pero es más probable que utilice [Octo]
Lectura relacionada OpenVLA vs Octo → Política de difusión vs ACT → Mejores modelos de VLA 2026 → Open X-Embodiment dataset → OpenVLA modelo página → RT-X modelo página →
Cada VLA aquí puede ser ajustado a sus propias demostraciones.
Recoge demos → Hardware que lo ejecuta → Corre una política →







