Volver a VLA Models

OpenVLA vs Octo: ¿Qué modelo de acción de lenguaje de visión gana?

Comparación entre cabezas de OpenVLA (7B) y Octo (27M/93M) <unk> arquitectura, capacitación Open-X, licencias, necesidades de hardware y adaptación de implementación. Elige el VLA correcto hoy.

Dos VLAs de peso abierto históricos entrenados en el cuerpo de X-embodiment abierto uno una bestia multimodal 7B, el otro un transformer de difusión 27M/93M delgado. ¿Cuál se adapta a su robot, su presupuesto de GPU, y su tarea?

Actualizado abril 2026 7B vs 93M params con licencia MIT

[Brasquear todos los modelos] T1) [Hablar con un ingeniero] T2)

TL;DR Elige OpenVLA cuando deseas un lenguaje amplio, una columna vertebral Llama-2, y el mejor comportamiento fuera de la caja de tiros cero en los puntos de referencia de manipulación y puedes permitirte un solo A100/H100 a la inferencia. Elige Octo cuando necesites un transformador de difusión compacto y rápido que se ajuste a bajo costo en diversas realizaciones y se ejecute en GPUs de productos básicos, aceptando una menor fidelidad del lenguaje a cambio de velocidad y flexibilidad.

Por qué esta comparación es importante

OpenVLA y Octo son los dos modelos de acción de lenguaje de visión de peso abierto más citados lanzados en 2024, y ambos entrenados en el conjunto de datos Open X-Embodiment. Si estás levantando una pila de aprendizaje de robot en 2026 ya sea para [recolección de almacén]T3), [automatización de laboratorio]T4), o un tubo de teleópicos humanoides uno de estos es casi seguro que es tu punto de partida. Pero los dos modelos fueron diseñados con filosofías muy diferentes, y la elección equivocada le costará semanas de ajuste fino y muchas horas de GPU.

Esta página recorre la arquitectura, los datos de capacitación, la huella de implementación, el acondicionamiento del lenguaje y las compensaciones honestas. Si desea la vista de directorio profunda, consulte nuestro [directorio de modelos VLA]T5) o el individuo [OpenVLA página]T6) y [Octo página]T7).

Comparación instantánea

Dimension OpenVLA Octo
Parameters 7B 27M (Octo-Small) / 93M (Octo-Base)
Backbone / architecture Llama-2 7B LLM + DINOv2 + SigLIP vision encoders Transformer diffusion policy from scratch, multimodal token stream
Action head Discretized action tokens output by the LLM Conditional diffusion over continuous actions (DDPM-style)
Training data ~970K trajectories from Open X-Embodiment ~800K trajectories from Open X-Embodiment
Language conditioning Native (LLM-level), strong instruction following Supported via text or goal-image tokens, weaker instruction grounding
Action space 7-DOF end-effector delta (extensible via fine-tune) Flexible — supports varied action dims across embodiments
Inference hardware ~16 GB VRAM bf16, ideally A100/H100/L40S for real-time Runs comfortably on a single RTX 4090 or smaller
Throughput (typical) ~5–10 Hz on A100 without quantization ~10–30 Hz on consumer GPUs with action chunking
Fine-tuning cost LoRA on 1× A100 is practical; full fine-tune needs multi-GPU Full fine-tune feasible on a single 24 GB GPU
License MIT MIT
Paper Kim et al., CoRL 2024 (arXiv:2406.09246) Octo Model Team, arXiv:2405.12213
Code github.com/openvla/openvla github.com/octo-models/octo

Arquitectura sumergida en profundidad

OpenVLA: un modelo de lenguaje-primero diseño

OpenVLA es fundamentalmente un Llama-2 7B que ha sido enseñado a emitir tokens de acción. Las imágenes se codifican por una pila visual fusionada DINOv2 + SigLIP y se proyectan en el flujo de tokens del LLM. Las acciones continuas se discretizan en 256 contenedores por dimensión y se tratan como un nuevo vocabulario que el modelo predice autoregresivamente. Debido a que el espacio de acción se expresa en el mismo espacio token que el lenguaje, heredas la generalización de composición del LLM. El modelo puede seguir nuevas instrucciones que nunca vio durante el entrenamiento, y los autores mostraron que supera a RT-2-X en las suites LIBERO y BridgeData V2 a pesar de usar 7 veces menos parámetros que la variante 55B de RT-2-X.

El costo es el tamaño: los pesos 7B de OpenVLA y la decodificación autoregressiva hacen que el control en tiempo real sea exigente. En la práctica, los equipos lo implementan con un proceso de acción, inferencia bfloat16, y una GPU dedicada de clase A100 o LoRA-tune una cabeza de acción más pequeña para un robot específico. OpenVLA en una plataforma OpenArm o AlphaRobot funciona, pero usted está pagando una prima por el comportamiento del lenguaje.

Octo: transformador de difusión a escala de políticas

Octo fue diseñado al revés. El equipo de Octo comenzó con la observación de que la mayoría de las políticas de robots no necesitan un modelo de lenguaje 7B necesitan una red pequeña, rápida y multimodal que pueda absorber variadas encarnaciones y espacios de acción. Octo es un transformador entrenado desde cero con una cabeza de difusión condicional que denota secuencias de acción condicionadas a imágenes, lenguaje e imágenes de meta. El juego de acción está en juego.

Las variantes 27M y 93M son lo suficientemente pequeñas como para servir a alta frecuencia en el hardware de consumo, y la formulación de difusión capta distribuciones de demostración multimodal de manera limpia haciendo que Octo sea un ajuste natural para los flujos de trabajo de aprendizaje de imitación [difusión-política-estilo]T8). La diferencia es que la comprensión del idioma de Octo se basa en la distribución del tiempo de entrenamiento en lugar de una LLM anterior, por lo que la instrucción de tiro cero siguiendo instrucciones verdaderamente nuevas es más débil que la de OpenVLA.

Datos de formación y generalización

Los dos modelos fueron entrenados en el conjunto de datos de [Open X-Embodiment] T9 el corpus multicultural de aproximadamente 970K trayectorias reales de robots en 22 encarnaciones. OpenVLA usó la versión completa de 970K; Octo usó un subconjunto de trayectoria de 800K curado. Esta procedencia compartida significa que ambos modelos han visto Franka, WidowX, Google Robot y una larga cola de brazos de laboratorio, pero sus sesgos inductivos difieren. OpenVLA hereda el modelo de lenguaje anterior (bueno para generalizar en las frases de instrucciones). Octo hereda el anterior de difusión (bueno para trayectorias multimodales y de alta frecuencia). Cuando ajustes bien los datos de teleop recopilados a través de los servicios de datos de RCSV, estos anteriores dan forma a la cantidad de datos que necesitas.

Cuando OpenVLA gana

  • Necesita un programa de lenguaje. Si los operadores emiten instrucciones de forma libre ("poner el bloque rojo a la izquierda de la taza"), la columna vertebral Llama-2 de OpenVLA le da una comprensión del lenguaje de composición fuera de la caja.
  • Tienes hardware de clase H100/A100. En una estación de trabajo con una GPU de 40 GB, OpenVLA funciona cómodamente y la fidelidad del lenguaje se paga por sí misma.
  • Desea un fuerte punto de partida de cero disparos antes de recopilar datos. Los números publicados de OpenVLA sobre LIBERO-Spatial, LIBERO-Object y BridgeData V2 son un sólido piso de partida.
  • Planeas ajustar a LoRA para una realización específica. La comunidad OpenVLA ha enviado muchas recetas de LoRA, y los pesos del adaptador son pequeños en comparación con el ajuste completo.

Cuando Octo gane

  • Estás implementando en una GPU de consumo de 24 GB o una caja de bordes. Octo-Small (27M) es lo suficientemente pequeño como para funcionar junto con las pilas de percepción y planificación.
  • Su tarea es la imitación de demostraciones multimodal. Las cabezas de difusión capturan naturalmente las distribuciones de demostraciones "hay tres formas de hacer esto" que colapsan las políticas de entropía cruzada.
  • Quiere ajustar a la perfección en diversas realizaciones. Octo fue construido explícitamente para aceptar diferentes dimensiones de acción y vistas de cámara un gran ajuste si su flota incluye plataformas bimanual y de un solo brazo.
  • La frecuencia de control es importante. La menor huella de Octo y la difusión en pedazos hacen posible el control de circuito cerrado de 2030 Hz en una sola GPU.

Compromiso honesto

Ninguno de los dos modelos es un ganador universal. La ventaja del lenguaje de OpenVLA desaparece una vez que se ajusta a una distribución de tareas estrecha en ese punto se pagan parámetros 7B por el comportamiento que una política de 93M podría producir. Por el contrario, el acondicionamiento de lenguaje de Octo puede fallar silenciosamente en instrucciones fuera de distribución, y el defectuoso "por qué el robot eligió el objeto equivocado" es más difícil cuando la política no tiene LLM para pedir. Si su implementación es ligera al lenguaje y de tareas estrechas (picking de contenedores, [kitting de almacén]T11), montaje de posición fija), Octo es casi siempre la llamada correcta. Si su implementación es pesada en el lenguaje y amplia en las tareas (asistencia doméstica, automatización flexible de laboratorio), OpenVLA gana su huella.

Indicadores de referencia para ver

En lugar de confiar en cualquier número de papel, recomendamos evaluar ambos modelos en su propia distribución de tareas utilizando suites estandarizadas. El [LIBERO benchmark]T12) cubre la manipulación de horizonte corto, [CALVIN]T13) cubre tareas de largo horizonte con el lenguaje, y [Google Robot]T14) cubre la generalización de la mesa. Tanto OpenVLA como Octo publican números de referencia en cada uno.

Un punto sutil pero importante: los números de referencia entre OpenVLA y Octo no siempre son manzanas a manzanas. Cuando se reproduce cualquiera de los dos, registra el punto de control exacto, la receta de ajuste fino y el protocolo de evaluación pequeñas diferencias en la temperatura, la acción de fragmentación y el ensamblaje temporal representan la mayor parte de la propagación que se ve en los resultados de la comunidad.

Para la cordura de la implementación, recomendamos también ejecutar un breve análisis interno de evaluación en diez episodios de su propia tarea antes de comprometerse con un modelo. El costo de esa comparación de dos días es mucho menor que el costo de ocho semanas de ajuste fino en la base equivocada.

Recetas de ajuste en la práctica

Ambos modelos han madurado tubos de ajuste fino, y las recetas revelan mucho sobre los modelos. La receta de referencia de OpenVLA LoRA entrena un adaptador de rango 16 para aproximadamente 20K50K pasos en un solo A100 de 80 GB con un tamaño de lote de 16, utilizando la pila de entrenamiento T0. Los puntos de control son típicamente 150200 MB para los adaptadores LoRA, lo que hace práctico enviar muchos adaptadores específicos de tareas contra una base compartida 7B una propiedad útil para las implementaciones [laboratorio-automatización] T15) donde cada estación de trabajo ejecuta un protocolo ligeramente diferente.

La historia de ajuste fino de Octo es más simple: cargas el punto de control base, adjuntas una cabeza específica de tarea si tu espacio de acción difiere, y ejecutas pasos de gradiente de 10K50K en tus datos de trayectoria. Debido a que el modelo es pequeño, los ajustes finos completos en una sola GPU de 24 GB son rutinarios, y la comunidad ha compartido recetas para Franka, UR5, xArm y varias plataformas humanoides. Si su tubería de datos ya está en formato LeRobot o RLDS, Octo la recogerá sin fricción.

Ecosistemas y herramientas

OpenVLA se beneficia del ecosistema Llama cada herramienta de cuantización, servicio y adaptador construida para la inferencia LLM se aplica. Puedes ejecutar OpenVLA a través de vLLM con muestras personalizadas, cuantificarlo a 4 bits con bitsandbytes, o compilarlo a TensorRT-LLM para el rendimiento de producción.

El ecosistema de Octo es más pequeño pero muy alineado con la robótica: LeRobot, RLDS y la mayoría de las pilas modernas de recopilación de datos lo apoyan de forma nativa.

Nuestra recomendación

Si esta es su primera implementación de VLA y tiene una estación de trabajo de clase A100, comience con OpenVLA el comportamiento del lenguaje le ahorrará semanas de ingeniería de plantillas rápidas, y la licencia MIT mantiene abiertas las vías comerciales. Si está implementando en hardware de consumo, ejecutando a alta frecuencia o apuntando a una tarea estrecha, elija Octo-Base y sintonice sus propios datos de teleop. Muchos equipos de producción terminan ejecutando both: OpenVLA como el front-end que sigue instrucciones, Octo como la política de bajo nivel rápida.

RCSV ha implementado tanto en OpenArm, Unitree G1 como en plataformas ALOHA móviles. Si desea una recomendación de modelo contra su robot y tarea específica, [reserva una llamada]

Lectura relacionada RT-X vs OpenVLA → Política de difusión vs ACT → Mejores modelos de VLA 2026 → Open X-Embodiment dataset → LIBERO benchmark → Recolección de datos de teleop →

Cada VLA aquí puede ser ajustado a sus propias demostraciones.

Collect demos → Hardware que lo ejecuta → Corre una política →